{"as_of":"2026-08-10T09:36:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:5b137e3df21cff2ab203709745382d2e5eb2a0c6f750ab9b7ee68646d74826c9","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":28,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":28,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":28,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":28,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-09T11:47:17.565775Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-03T01:17:30.660177Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2309.06657","last_updated":"2024-01-23T23:16:11Z","snapshot_observed_at":"2026-08-09T18:55:35.113802Z","submitted_at":"2023-09-13T01:07:25Z","title":"Statistical Rejection Sampling Improves Preference Optimization","version":2},"cited_work":{"arxiv_id":"2309.06657","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2309.06657","snapshot_observed_at":"2026-07-03T01:17:30.660177Z","title":"Statistical re- jection sampling improves preference optimization","venue":null,"work_id":"678d44cc-5ccf-44b3-b408-6442481bb136","year":2023},"citing_paper":{"arxiv_id":"2411.10442","last_updated":"2025-04-07T09:09:39Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-11-15T18:59:27Z","title":"Enhancing the Reasoning Ability of Multimodal Large Language Models via Mixed Preference Optimization","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-05-16T09:16:17.150383Z"},"links":{"cited_paper":"/paper/2309.06657","citing_paper":"/paper/2411.10442"},"observation_digest":"sha256:c3d947acacebe2dd8959e1df70fcdc2ef264f44f761f854ede7a2944006c90bc","observation_id":"c33e5668-b295-4b15-9dba-830b5acee434","resolution":{"observed_at":"2026-05-16T09:16:17.289989Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.06657","last_updated":"2024-01-23T23:16:11Z","snapshot_observed_at":"2026-08-09T18:55:35.113802Z","submitted_at":"2023-09-13T01:07:25Z","title":"Statistical Rejection Sampling Improves Preference Optimization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.06657","snapshot_observed_at":"2026-08-09T11:47:17.565775Z","title":"J., and Liu, J","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.04354","last_updated":"2025-02-04T18:47:11Z","snapshot_observed_at":"2026-08-09T19:08:38.829460Z","submitted_at":"2025-02-04T18:47:11Z","title":"Reviving The Classics: Active Reward Modeling in Large Language Model Alignment","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-09T11:47:17.565775Z"},"links":{"cited_paper":"/paper/2309.06657","citing_paper":"/paper/2502.04354"},"observation_digest":"sha256:472ee2a159779dc5ee08ea4e793735dd0153f91cedaa36e31757bedf32cdbb87","observation_id":"9f60a0c9-e24e-48f1-9307-f3c5565b4fa2","resolution":{"observed_at":"2026-08-09T11:47:17.565775Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.06657","last_updated":"2024-01-23T23:16:11Z","snapshot_observed_at":"2026-08-09T18:55:35.113802Z","submitted_at":"2023-09-13T01:07:25Z","title":"Statistical Rejection Sampling Improves Preference Optimization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.06657","snapshot_observed_at":"2026-08-07T14:01:05.396920Z","title":"Statistical rejection sampling improves preference optimization","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.20556","last_updated":"2025-05-26T22:34:42Z","snapshot_observed_at":"2026-08-09T01:22:43.161220Z","submitted_at":"2025-05-26T22:34:42Z","title":"Learning a Pessimistic Reward Model in RLHF","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T14:01:05.396920Z"},"links":{"cited_paper":"/paper/2309.06657","citing_paper":"/paper/2505.20556"},"observation_digest":"sha256:8d66b07d7756063b6cfd645c8b3a22a04a4f1158d441fdca84d8ab0ae86844ed","observation_id":"10740686-15de-458a-8a08-82ef54fc1c73","resolution":{"observed_at":"2026-08-07T14:01:05.396920Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.06657","last_updated":"2024-01-23T23:16:11Z","snapshot_observed_at":"2026-08-09T18:55:35.113802Z","submitted_at":"2023-09-13T01:07:25Z","title":"Statistical Rejection Sampling Improves Preference Optimization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.06657","snapshot_observed_at":"2026-08-07T13:44:57.881471Z","title":"J., and Liu, J","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.21395","last_updated":"2025-05-27T16:23:24Z","snapshot_observed_at":"2026-08-07T13:26:21.678395Z","submitted_at":"2025-05-27T16:23:24Z","title":"Square$\\chi$PO: Differentially Private and Robust $\\chi^2$-Preference Optimization in Offline Direct Alignment","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-07T13:44:57.881471Z"},"links":{"cited_paper":"/paper/2309.06657","citing_paper":"/paper/2505.21395"},"observation_digest":"sha256:cdd6b2df434a79cb182bcf01e5d1fc82f5f5b113235bc009d86ba64c8042a632","observation_id":"9d2fe920-b1a1-4ac1-acf1-4f5e463db2ba","resolution":{"observed_at":"2026-08-07T13:44:57.881471Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.06657","last_updated":"2024-01-23T23:16:11Z","snapshot_observed_at":"2026-08-09T18:55:35.113802Z","submitted_at":"2023-09-13T01:07:25Z","title":"Statistical Rejection Sampling Improves Preference Optimization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.06657","snapshot_observed_at":"2026-08-07T13:24:30.648329Z","title":"Statistical rejection sampling improves preference optimization","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.21907","last_updated":"2025-05-31T04:48:02Z","snapshot_observed_at":"2026-08-09T21:30:35.237559Z","submitted_at":"2025-05-28T02:52:39Z","title":"Modeling and Optimizing User Preferences in AI Copilots: A Comprehensive Survey and Taxonomy","version":2},"reference_index":104,"source":"pdf_text","source_observed_at":"2026-08-07T13:24:30.648329Z"},"links":{"cited_paper":"/paper/2309.06657","citing_paper":"/paper/2505.21907"},"observation_digest":"sha256:f8fe95577bdde0d1443a655634204a42d5b131782ee52aca319c6fc34c317217","observation_id":"41e00320-9fdb-472b-a391-488796e832a0","resolution":{"observed_at":"2026-08-07T13:24:30.648329Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.06657","last_updated":"2024-01-23T23:16:11Z","snapshot_observed_at":"2026-08-09T18:55:35.113802Z","submitted_at":"2023-09-13T01:07:25Z","title":"Statistical Rejection Sampling Improves Preference Optimization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.06657","snapshot_observed_at":"2026-08-07T12:43:48.431444Z","title":"Liu, and Jialu Liu","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.23927","last_updated":"2025-05-29T18:22:02Z","snapshot_observed_at":"2026-08-09T08:37:01.244014Z","submitted_at":"2025-05-29T18:22:02Z","title":"Thompson Sampling in Online RLHF with General Function Approximation","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:48.431444Z"},"links":{"cited_paper":"/paper/2309.06657","citing_paper":"/paper/2505.23927"},"observation_digest":"sha256:1362e7547dc7355bb693145d113f1908384859006b05c69a85afe13dd2901ac3","observation_id":"5e9a7c7f-6d8b-48bb-a13c-f3dd10c93cb9","resolution":{"observed_at":"2026-08-07T12:43:48.431444Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.06657","last_updated":"2024-01-23T23:16:11Z","snapshot_observed_at":"2026-08-09T18:55:35.113802Z","submitted_at":"2023-09-13T01:07:25Z","title":"Statistical Rejection Sampling Improves Preference Optimization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.06657","snapshot_observed_at":"2026-08-07T11:26:57.308215Z","title":"J., and Liu, J","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.02698","last_updated":"2025-06-06T03:14:26Z","snapshot_observed_at":"2026-08-09T04:25:20.294383Z","submitted_at":"2025-06-03T09:47:22Z","title":"Smoothed Preference Optimization via ReNoise Inversion for Aligning Diffusion Models with Varied Human Preferences","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T11:26:57.308215Z"},"links":{"cited_paper":"/paper/2309.06657","citing_paper":"/paper/2506.02698"},"observation_digest":"sha256:2be9495017512f5c343c03cff8b29f16c23588a7a5e785dd6b1d10e6065f76b7","observation_id":"8d9f8622-e1c9-452a-a71b-742cf211ddd4","resolution":{"observed_at":"2026-08-07T11:26:57.308215Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.06657","last_updated":"2024-01-23T23:16:11Z","snapshot_observed_at":"2026-08-09T18:55:35.113802Z","submitted_at":"2023-09-13T01:07:25Z","title":"Statistical Rejection Sampling Improves Preference Optimization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.06657","snapshot_observed_at":"2026-08-07T04:24:02.421271Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.10822","last_updated":"2025-06-12T15:43:01Z","snapshot_observed_at":"2026-08-09T12:18:57.638586Z","submitted_at":"2025-06-12T15:43:01Z","title":"ReCUT: Balancing Reasoning Length and Accuracy in LLMs via Stepwise Trails and Preference Optimization","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-07T04:24:02.421271Z"},"links":{"cited_paper":"/paper/2309.06657","citing_paper":"/paper/2506.10822"},"observation_digest":"sha256:0a0f962a379d56d39e02c3e40cf1b884e33d11f57b5db44f2614e2cacc0c794a","observation_id":"4c055b56-2701-4ae8-8fbb-2fc9eba799b1","resolution":{"observed_at":"2026-08-07T04:24:02.421271Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.06657","last_updated":"2024-01-23T23:16:11Z","snapshot_observed_at":"2026-08-09T18:55:35.113802Z","submitted_at":"2023-09-13T01:07:25Z","title":"Statistical Rejection Sampling Improves Preference Optimization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.06657","snapshot_observed_at":"2026-08-06T22:28:07.163268Z","title":"Statistical rejection sampling improves preference optimization","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.21495","last_updated":"2025-06-26T17:25:49Z","snapshot_observed_at":"2026-08-10T08:41:39.759749Z","submitted_at":"2025-06-26T17:25:49Z","title":"Bridging Offline and Online Reinforcement Learning for LLMs","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-06T22:28:07.163268Z"},"links":{"cited_paper":"/paper/2309.06657","citing_paper":"/paper/2506.21495"},"observation_digest":"sha256:86ad8a3276b3e75b88312c3783281652d73ff216d4fb665552759e00ea3820b8","observation_id":"d68b4f96-d8a1-4c78-a8f5-74ec1ec203de","resolution":{"observed_at":"2026-08-06T22:28:07.163268Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.06657","last_updated":"2024-01-23T23:16:11Z","snapshot_observed_at":"2026-08-09T18:55:35.113802Z","submitted_at":"2023-09-13T01:07:25Z","title":"Statistical Rejection Sampling Improves Preference Optimization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.06657","snapshot_observed_at":"2026-08-06T16:34:25.092262Z","title":"Statistical rejection sampling improves preference optimization.arXiv preprint arXiv:2309.06657,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.13158","last_updated":"2025-07-17T14:22:24Z","snapshot_observed_at":"2026-08-09T20:19:53.961381Z","submitted_at":"2025-07-17T14:22:24Z","title":"Inverse Reinforcement Learning Meets Large Language Model Post-Training: Basics, Advances, and Opportunities","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-06T16:34:25.092262Z"},"links":{"cited_paper":"/paper/2309.06657","citing_paper":"/paper/2507.13158"},"observation_digest":"sha256:0e36d70666b1d7b892944b9d7e2822901ef7351741047396a2c3c6411228eea1","observation_id":"8345db02-524c-42cc-9e93-99dfba1bf963","resolution":{"observed_at":"2026-08-06T16:34:25.092262Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.06657","last_updated":"2024-01-23T23:16:11Z","snapshot_observed_at":"2026-08-09T18:55:35.113802Z","submitted_at":"2023-09-13T01:07:25Z","title":"Statistical Rejection Sampling Improves Preference Optimization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.06657","snapshot_observed_at":"2026-08-05T23:06:49.645169Z","title":"J.; and Liu, J","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.06026","last_updated":"2025-08-08T05:25:54Z","snapshot_observed_at":"2026-08-08T09:51:41.415322Z","submitted_at":"2025-08-08T05:25:54Z","title":"Temporal Self-Rewarding Language Models: Decoupling Chosen-Rejected via Past-Future","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-05T23:06:49.645169Z"},"links":{"cited_paper":"/paper/2309.06657","citing_paper":"/paper/2508.06026"},"observation_digest":"sha256:3421cd4536e3e1ac84fee29a7f101cff6851a4987d8447c7b117255a73411cc1","observation_id":"092382b6-2b8c-42d5-9650-e3796259d9ac","resolution":{"observed_at":"2026-08-05T23:06:49.645169Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.06657","last_updated":"2024-01-23T23:16:11Z","snapshot_observed_at":"2026-08-09T18:55:35.113802Z","submitted_at":"2023-09-13T01:07:25Z","title":"Statistical Rejection Sampling Improves Preference Optimization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.06657","snapshot_observed_at":"2026-08-05T16:30:13.422573Z","title":"Statistical rejection sampling improves preference optimization","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.18391","last_updated":"2025-08-25T18:31:03Z","snapshot_observed_at":"2026-08-09T04:26:34.374616Z","submitted_at":"2025-08-25T18:31:03Z","title":"PKG-DPO: Optimizing Domain-Specific AI systems with Physics Knowledge Graphs and Direct Preference Optimization","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-05T16:30:13.422573Z"},"links":{"cited_paper":"/paper/2309.06657","citing_paper":"/paper/2508.18391"},"observation_digest":"sha256:711f44b10d68173a8ef7f524ff29dad453e378a55dcebce43792298286396b0f","observation_id":"b8b226be-80c6-4ec8-90d4-8fd3d7beda10","resolution":{"observed_at":"2026-08-05T16:30:13.422573Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.06657","last_updated":"2024-01-23T23:16:11Z","snapshot_observed_at":"2026-08-09T18:55:35.113802Z","submitted_at":"2023-09-13T01:07:25Z","title":"Statistical Rejection Sampling Improves Preference Optimization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.06657","snapshot_observed_at":"2026-08-05T11:30:39.841578Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.02754","last_updated":"2025-09-02T19:02:49Z","snapshot_observed_at":"2026-08-10T05:54:00.992954Z","submitted_at":"2025-09-02T19:02:49Z","title":"Do LLM Modules Generalize? A Study on Motion Generation for Autonomous Driving","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-05T11:30:39.841578Z"},"links":{"cited_paper":"/paper/2309.06657","citing_paper":"/paper/2509.02754"},"observation_digest":"sha256:10a8939bae06e3815a458c6f8a85e603749299952689c23094c15c5219b8eac5","observation_id":"72979ff6-f349-44ed-a7d6-d56854c786b7","resolution":{"observed_at":"2026-08-05T11:30:39.841578Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.06657","last_updated":"2024-01-23T23:16:11Z","snapshot_observed_at":"2026-08-09T18:55:35.113802Z","submitted_at":"2023-09-13T01:07:25Z","title":"Statistical Rejection Sampling Improves Preference Optimization","version":2},"cited_work":{"arxiv_id":"2309.06657","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2309.06657","snapshot_observed_at":"2026-07-03T01:17:30.660177Z","title":"Statistical re- jection sampling improves preference optimization","venue":null,"work_id":"678d44cc-5ccf-44b3-b408-6442481bb136","year":2023},"citing_paper":{"arxiv_id":"2510.07972","last_updated":"2026-04-13T14:08:13Z","snapshot_observed_at":"2026-08-06T02:37:16.242841Z","submitted_at":"2025-10-09T09:03:15Z","title":"SHE: Stepwise Hybrid Examination Reinforcement Learning Framework for E-commerce Search Relevance","version":3},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-18T09:33:57.037949Z"},"links":{"cited_paper":"/paper/2309.06657","citing_paper":"/paper/2510.07972"},"observation_digest":"sha256:00db807e95885b2725a5cd6757fb6f4c55353b5170ff9222683cc3bad1ddce76","observation_id":"0ea8dbbf-0c3d-4d0c-b1c7-fb18f039d4e7","resolution":{"observed_at":"2026-05-18T09:36:11.230544Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.06657","last_updated":"2024-01-23T23:16:11Z","snapshot_observed_at":"2026-08-09T18:55:35.113802Z","submitted_at":"2023-09-13T01:07:25Z","title":"Statistical Rejection Sampling Improves Preference Optimization","version":2},"cited_work":{"arxiv_id":"2309.06657","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2309.06657","snapshot_observed_at":"2026-07-03T01:17:30.660177Z","title":"Statistical re- jection sampling improves preference optimization","venue":null,"work_id":"678d44cc-5ccf-44b3-b408-6442481bb136","year":2023},"citing_paper":{"arxiv_id":"2604.14895","last_updated":"2026-04-16T11:39:11Z","snapshot_observed_at":"2026-07-06T23:02:36.062162Z","submitted_at":"2026-04-16T11:39:11Z","title":"Beyond Importance Sampling: Rejection-Gated Policy Optimization","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-10T11:27:31.464362Z"},"links":{"cited_paper":"/paper/2309.06657","citing_paper":"/paper/2604.14895"},"observation_digest":"sha256:8d3e697864bc8684ebd31b837465e0e4a771e4340a92c9731368fd819b89ece6","observation_id":"0fdf0e4a-ba7e-46c6-9975-7e81f73d13b9","resolution":{"observed_at":"2026-05-10T11:30:18.778593Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.06657","last_updated":"2024-01-23T23:16:11Z","snapshot_observed_at":"2026-08-09T18:55:35.113802Z","submitted_at":"2023-09-13T01:07:25Z","title":"Statistical Rejection Sampling Improves Preference Optimization","version":2},"cited_work":{"arxiv_id":"2309.06657","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2309.06657","snapshot_observed_at":"2026-07-03T01:17:30.660177Z","title":"Statistical re- jection sampling improves preference optimization","venue":null,"work_id":"678d44cc-5ccf-44b3-b408-6442481bb136","year":2023},"citing_paper":{"arxiv_id":"2604.18946","last_updated":"2026-04-21T00:50:13Z","snapshot_observed_at":"2026-07-06T23:05:39.724237Z","submitted_at":"2026-04-21T00:50:13Z","title":"Reasoning Structure Matters for Safety Alignment of Reasoning Models","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-05-10T02:36:57.093584Z"},"links":{"cited_paper":"/paper/2309.06657","citing_paper":"/paper/2604.18946"},"observation_digest":"sha256:4910b1fed528b0f4a4b8666e824ec94b6b52248753187337fa0567c138d45bd0","observation_id":"a2a2cfc4-c3ad-45dd-89c0-3094a38f3b29","resolution":{"observed_at":"2026-05-11T12:56:04.115722Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.06657","last_updated":"2024-01-23T23:16:11Z","snapshot_observed_at":"2026-08-09T18:55:35.113802Z","submitted_at":"2023-09-13T01:07:25Z","title":"Statistical Rejection Sampling Improves Preference Optimization","version":2},"cited_work":{"arxiv_id":"2309.06657","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2309.06657","snapshot_observed_at":"2026-07-03T01:17:30.660177Z","title":"Statistical re- jection sampling improves preference optimization","venue":null,"work_id":"678d44cc-5ccf-44b3-b408-6442481bb136","year":2023},"citing_paper":{"arxiv_id":"2604.20140","last_updated":"2026-04-22T03:08:30Z","snapshot_observed_at":"2026-07-06T23:06:40.154278Z","submitted_at":"2026-04-22T03:08:30Z","title":"HiPO: Hierarchical Preference Optimization for Adaptive Reasoning in LLMs","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-10T00:51:37.506096Z"},"links":{"cited_paper":"/paper/2309.06657","citing_paper":"/paper/2604.20140"},"observation_digest":"sha256:b99acfcbe9d7b4a985986f696166294c4be548e9e5b73d8c292bc5e2d08798c9","observation_id":"37f56f6a-d22a-466c-b5aa-bcf3033f0566","resolution":{"observed_at":"2026-05-10T00:54:48.584130Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.06657","last_updated":"2024-01-23T23:16:11Z","snapshot_observed_at":"2026-08-09T18:55:35.113802Z","submitted_at":"2023-09-13T01:07:25Z","title":"Statistical Rejection Sampling Improves Preference Optimization","version":2},"cited_work":{"arxiv_id":"2309.06657","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2309.06657","snapshot_observed_at":"2026-07-03T01:17:30.660177Z","title":"Statistical re- jection sampling improves preference optimization","venue":null,"work_id":"678d44cc-5ccf-44b3-b408-6442481bb136","year":2023},"citing_paper":{"arxiv_id":"2604.20727","last_updated":"2026-04-22T16:12:36Z","snapshot_observed_at":"2026-07-06T23:07:25.185196Z","submitted_at":"2026-04-22T16:12:36Z","title":"Supplement Generation Training for Enhancing Agentic Task Performance","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-05-10T00:58:27.655909Z"},"links":{"cited_paper":"/paper/2309.06657","citing_paper":"/paper/2604.20727"},"observation_digest":"sha256:5e7324fb33054e2b45537342e9f228c0b47b5c5476430660b62e20e1d7b2cf36","observation_id":"50a5ae45-660c-4b1b-b769-58288a06f74b","resolution":{"observed_at":"2026-05-10T00:59:49.531092Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.06657","last_updated":"2024-01-23T23:16:11Z","snapshot_observed_at":"2026-08-09T18:55:35.113802Z","submitted_at":"2023-09-13T01:07:25Z","title":"Statistical Rejection Sampling Improves Preference Optimization","version":2},"cited_work":{"arxiv_id":"2309.06657","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2309.06657","snapshot_observed_at":"2026-07-03T01:17:30.660177Z","title":"Statistical re- jection sampling improves preference optimization","venue":null,"work_id":"678d44cc-5ccf-44b3-b408-6442481bb136","year":2023},"citing_paper":{"arxiv_id":"2605.02495","last_updated":"2026-05-25T07:21:41Z","snapshot_observed_at":"2026-07-06T23:15:32.349713Z","submitted_at":"2026-05-04T11:45:38Z","title":"Efficient Preference Poisoning Attack on Offline RLHF","version":1},"reference_index":80,"source":"arxiv_source","source_observed_at":"2026-05-08T19:29:25.000361Z"},"links":{"cited_paper":"/paper/2309.06657","citing_paper":"/paper/2605.02495"},"observation_digest":"sha256:bd2420e4686e53c45d2d2a2782f4114d750df3018e1d062b9de771e447778844","observation_id":"8f1a64bc-0b13-4256-9573-312652e6000e","resolution":{"observed_at":"2026-05-09T05:50:27.173052Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.06657","last_updated":"2024-01-23T23:16:11Z","snapshot_observed_at":"2026-08-09T18:55:35.113802Z","submitted_at":"2023-09-13T01:07:25Z","title":"Statistical Rejection Sampling Improves Preference Optimization","version":2},"cited_work":{"arxiv_id":"2309.06657","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2309.06657","snapshot_observed_at":"2026-07-03T01:17:30.660177Z","title":"Statistical re- jection sampling improves preference optimization","venue":null,"work_id":"678d44cc-5ccf-44b3-b408-6442481bb136","year":2023},"citing_paper":{"arxiv_id":"2605.06650","last_updated":"2026-05-07T17:55:21Z","snapshot_observed_at":"2026-07-06T23:19:05.764765Z","submitted_at":"2026-05-07T17:55:21Z","title":"Beyond Negative Rollouts: Positive-Only Policy Optimization with Implicit Negative Gradients","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-05-08T09:53:32.077464Z"},"links":{"cited_paper":"/paper/2309.06657","citing_paper":"/paper/2605.06650"},"observation_digest":"sha256:fe2ca67c81b72e755e55c6451a0f35d8d005608403b5a801bd99aabc96fc0eaf","observation_id":"359e0d48-73cc-4d37-a616-09c67fa5c344","resolution":{"observed_at":"2026-05-11T20:16:08.547916Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.06657","last_updated":"2024-01-23T23:16:11Z","snapshot_observed_at":"2026-08-09T18:55:35.113802Z","submitted_at":"2023-09-13T01:07:25Z","title":"Statistical Rejection Sampling Improves Preference Optimization","version":2},"cited_work":{"arxiv_id":"2309.06657","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2309.06657","snapshot_observed_at":"2026-07-03T01:17:30.660177Z","title":"Statistical re- jection sampling improves preference optimization","venue":null,"work_id":"678d44cc-5ccf-44b3-b408-6442481bb136","year":2023},"citing_paper":{"arxiv_id":"2605.06987","last_updated":"2026-05-07T22:05:23Z","snapshot_observed_at":"2026-07-31T05:30:22.249144Z","submitted_at":"2026-05-07T22:05:23Z","title":"Response Time Enhances Alignment with Heterogeneous Preferences","version":1},"reference_index":166,"source":"arxiv_source","source_observed_at":"2026-05-11T01:04:26.288913Z"},"links":{"cited_paper":"/paper/2309.06657","citing_paper":"/paper/2605.06987"},"observation_digest":"sha256:8941f037f2326e51919dc7bb45643b65d62e0718b749c723b491108b7b2490a0","observation_id":"8070190b-b727-4a74-b125-30ae1a237423","resolution":{"observed_at":"2026-05-11T04:45:59.782062Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.06657","last_updated":"2024-01-23T23:16:11Z","snapshot_observed_at":"2026-08-09T18:55:35.113802Z","submitted_at":"2023-09-13T01:07:25Z","title":"Statistical Rejection Sampling Improves Preference Optimization","version":2},"cited_work":{"arxiv_id":"2309.06657","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2309.06657","snapshot_observed_at":"2026-07-03T01:17:30.660177Z","title":"Statistical re- jection sampling improves preference optimization","venue":null,"work_id":"678d44cc-5ccf-44b3-b408-6442481bb136","year":2023},"citing_paper":{"arxiv_id":"2605.12288","last_updated":"2026-06-10T07:32:21Z","snapshot_observed_at":"2026-07-06T23:23:59.123377Z","submitted_at":"2026-05-12T15:44:33Z","title":"TokenRatio: Principled Token-Level Preference Optimization via Ratio Matching","version":1},"reference_index":112,"source":"arxiv_source","source_observed_at":"2026-05-13T04:55:55.013900Z"},"links":{"cited_paper":"/paper/2309.06657","citing_paper":"/paper/2605.12288"},"observation_digest":"sha256:d5a6d22279bf2dff277c85fad7f115d04b37fbfb1eb0298a57d0478855dfec31","observation_id":"562b6676-0d06-48a8-beef-5182bb4a7395","resolution":{"observed_at":"2026-05-13T04:57:17.284521Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.06657","last_updated":"2024-01-23T23:16:11Z","snapshot_observed_at":"2026-08-09T18:55:35.113802Z","submitted_at":"2023-09-13T01:07:25Z","title":"Statistical Rejection Sampling Improves Preference Optimization","version":2},"cited_work":{"arxiv_id":"2309.06657","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2309.06657","snapshot_observed_at":"2026-07-03T01:17:30.660177Z","title":"Statistical re- jection sampling improves preference optimization","venue":null,"work_id":"678d44cc-5ccf-44b3-b408-6442481bb136","year":2023},"citing_paper":{"arxiv_id":"2605.12288","last_updated":"2026-06-10T07:32:21Z","snapshot_observed_at":"2026-07-06T23:23:59.123377Z","submitted_at":"2026-05-12T15:44:33Z","title":"TokenRatio: Principled Token-Level Preference Optimization via Ratio Matching","version":2},"reference_index":112,"source":"arxiv_source","source_observed_at":"2026-05-15T05:41:10.714594Z"},"links":{"cited_paper":"/paper/2309.06657","citing_paper":"/paper/2605.12288"},"observation_digest":"sha256:b53bba8ecae3a095cba706c14391e25896083129918ad5f8dfd8e3037dec39af","observation_id":"8df7b4cb-a5d7-49bb-8496-79b847b3a2a6","resolution":{"observed_at":"2026-05-15T05:45:06.667802Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.06657","last_updated":"2024-01-23T23:16:11Z","snapshot_observed_at":"2026-08-09T18:55:35.113802Z","submitted_at":"2023-09-13T01:07:25Z","title":"Statistical Rejection Sampling Improves Preference Optimization","version":2},"cited_work":{"arxiv_id":"2309.06657","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2309.06657","snapshot_observed_at":"2026-07-03T01:17:30.660177Z","title":"Statistical re- jection sampling improves preference optimization","venue":null,"work_id":"678d44cc-5ccf-44b3-b408-6442481bb136","year":2023},"citing_paper":{"arxiv_id":"2606.09635","last_updated":"2026-06-08T15:33:13Z","snapshot_observed_at":"2026-08-02T03:20:14.810565Z","submitted_at":"2026-06-08T15:33:13Z","title":"Gradient-Guided Reward Optimization for Inference-time Alignment","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-06-27T16:43:04.984866Z"},"links":{"cited_paper":"/paper/2309.06657","citing_paper":"/paper/2606.09635"},"observation_digest":"sha256:c0eba39210e4c641f937b54346b109e9dbe298da5e06e7fa1a10a799fab66c07","observation_id":"83ac0f78-88ac-4817-9194-7682d793bd13","resolution":{"observed_at":"2026-07-03T01:17:30.661524Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.06657","last_updated":"2024-01-23T23:16:11Z","snapshot_observed_at":"2026-08-09T18:55:35.113802Z","submitted_at":"2023-09-13T01:07:25Z","title":"Statistical Rejection Sampling Improves Preference Optimization","version":2},"cited_work":{"arxiv_id":"2309.06657","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2309.06657","snapshot_observed_at":"2026-07-03T01:17:30.660177Z","title":"Statistical re- jection sampling improves preference optimization","venue":null,"work_id":"678d44cc-5ccf-44b3-b408-6442481bb136","year":2023},"citing_paper":{"arxiv_id":"2606.28707","last_updated":"2026-06-27T03:25:53Z","snapshot_observed_at":"2026-07-07T00:02:47.924620Z","submitted_at":"2026-06-27T03:25:53Z","title":"BV-Blend: Uncertainty-Weighted Historical Baselines for Stable Critic-Free RL with Verifiable Rewards","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-06-30T10:07:39.554999Z"},"links":{"cited_paper":"/paper/2309.06657","citing_paper":"/paper/2606.28707"},"observation_digest":"sha256:795d1e9329a9d64f4033ab770737d4b3a3c20aec1e889aae333457bb3f9eecfd","observation_id":"83c5d7a1-e3bf-44bd-afd3-774f0fea94e4","resolution":{"observed_at":"2026-06-30T12:44:40.158482Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.06657","last_updated":"2024-01-23T23:16:11Z","snapshot_observed_at":"2026-08-09T18:55:35.113802Z","submitted_at":"2023-09-13T01:07:25Z","title":"Statistical Rejection Sampling Improves Preference Optimization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.06657","snapshot_observed_at":"2026-07-11T13:53:36.775836Z","title":"arXiv preprint arXiv:2309.06657 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04763","last_updated":"2026-07-26T14:17:18Z","snapshot_observed_at":"2026-08-02T10:24:43.977557Z","submitted_at":"2026-07-06T07:56:53Z","title":"Multi-Turn On-Policy Distillation with Prefix Replay","version":1},"reference_index":261,"source":"arxiv_source","source_observed_at":"2026-07-11T13:53:36.775836Z"},"links":{"cited_paper":"/paper/2309.06657","citing_paper":"/paper/2607.04763"},"observation_digest":"sha256:50e27457afe713824bbcbecc0e5a690d77b14c405bd694b4c4a7cf1d90cf2ae3","observation_id":"d44c5aba-3f08-4bb6-b0d3-ca20f5df1148","resolution":{"observed_at":"2026-07-11T13:53:36.775836Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.06657","last_updated":"2024-01-23T23:16:11Z","snapshot_observed_at":"2026-08-09T18:55:35.113802Z","submitted_at":"2023-09-13T01:07:25Z","title":"Statistical Rejection Sampling Improves Preference Optimization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.06657","snapshot_observed_at":"2026-08-02T08:41:02.899448Z","title":"arXiv preprint arXiv:2309.06657 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04763","last_updated":"2026-07-26T14:17:18Z","snapshot_observed_at":"2026-08-02T10:24:43.977557Z","submitted_at":"2026-07-06T07:56:53Z","title":"Multi-Turn On-Policy Distillation with Prefix Replay","version":3},"reference_index":262,"source":"arxiv_source","source_observed_at":"2026-08-02T08:41:02.899448Z"},"links":{"cited_paper":"/paper/2309.06657","citing_paper":"/paper/2607.04763"},"observation_digest":"sha256:b2b15dba72d244fdd75aa357a2097059cc4bf53cb23b63938b4ac1a1249afd88","observation_id":"8c2d654c-71e1-4dc5-b084-4cc6390e2569","resolution":{"observed_at":"2026-08-02T08:41:02.899448Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.06657","last_updated":"2024-01-23T23:16:11Z","snapshot_observed_at":"2026-08-09T18:55:35.113802Z","submitted_at":"2023-09-13T01:07:25Z","title":"Statistical Rejection Sampling Improves Preference Optimization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.06657","snapshot_observed_at":"2026-08-01T07:28:20.944852Z","title":"arXiv preprint arXiv:2309.06657 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.21453","last_updated":"2026-07-24T02:14:44Z","snapshot_observed_at":"2026-08-03T14:01:50.133228Z","submitted_at":"2026-07-23T15:55:29Z","title":"Test-Time Scaling via Error Localization","version":2},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-01T07:28:20.944852Z"},"links":{"cited_paper":"/paper/2309.06657","citing_paper":"/paper/2607.21453"},"observation_digest":"sha256:57f6001f516bc0b20a10400de01e4c334158a82018ce363308cabf0931527837","observation_id":"4bdf339d-0117-4b99-ad3b-f719cd719c69","resolution":{"observed_at":"2026-08-01T07:28:20.944852Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2309.06657/citation-record","integrity":"/paper/2309.06657/integrity","json":"/paper/2309.06657/citation-record.json","paper":"/paper/2309.06657"},"outbound":[],"paper":{"arxiv_id":"2309.06657","last_updated":"2024-01-23T23:16:11Z","latest_version":2,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-09T18:55:35.113802Z","submitted_at":"2023-09-13T01:07:25Z","title":"Statistical Rejection Sampling Improves Preference Optimization"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 28 inbound Pith citation observations for arXiv:2309.06657."}