{"as_of":"2026-08-08T10:23:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:d6e302fd4bf2fe8f835dd6deb16a5de465e7fefc63624fc7049180f7256df16d","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":16,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":16,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":16,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":16,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T14:31:46.360499Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-23T03:52:29.455696Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2402.05749","last_updated":"2024-05-28T23:25:15Z","snapshot_observed_at":"2026-07-06T17:27:29.050237Z","submitted_at":"2024-02-08T15:33:09Z","title":"Generalized Preference Optimization: A Unified Approach to Offline Alignment","version":2},"cited_work":{"arxiv_id":"2402.05749","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2402.05749","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"D., Zheng, Z., Calandriello, D., Munos, R., Rowland, M., Richemond, P","venue":null,"work_id":"06aa59f7-1662-4884-a7e5-971d50ed9fa1","year":2024},"citing_paper":{"arxiv_id":"2502.01237","last_updated":"2026-05-08T19:36:24Z","snapshot_observed_at":"2026-08-06T16:27:29.744138Z","submitted_at":"2025-02-03T10:54:14Z","title":"The Differences Between Direct Alignment Algorithms are a Blur","version":3},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-05-23T03:50:03.720389Z"},"links":{"cited_paper":"/paper/2402.05749","citing_paper":"/paper/2502.01237"},"observation_digest":"sha256:049367c586af598541af9980609925d56660a089d93ba84ca952a0532b6fea8d","observation_id":"47600c21-1a3d-4c32-8cd1-207366753daa","resolution":{"observed_at":"2026-05-23T03:52:29.458777Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.05749","last_updated":"2024-05-28T23:25:15Z","snapshot_observed_at":"2026-07-06T17:27:29.050237Z","submitted_at":"2024-02-08T15:33:09Z","title":"Generalized Preference Optimization: A Unified Approach to Offline Alignment","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.05749","snapshot_observed_at":"2026-08-07T14:01:06.110662Z","title":"Generalized preference optimization: A unified approach to offline alignment.arXiv preprint arXiv:2402.05749,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.20556","last_updated":"2025-05-26T22:34:42Z","snapshot_observed_at":"2026-08-07T13:49:33.928724Z","submitted_at":"2025-05-26T22:34:42Z","title":"Learning a Pessimistic Reward Model in RLHF","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T14:01:06.110662Z"},"links":{"cited_paper":"/paper/2402.05749","citing_paper":"/paper/2505.20556"},"observation_digest":"sha256:36fd94ed578dbbc7e302bc6cfa1cd79fd07eea50424c7ce8282f131448a26b21","observation_id":"400d8bdf-8572-4ceb-ba4e-f027564c672b","resolution":{"observed_at":"2026-08-07T14:01:06.110662Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.05749","last_updated":"2024-05-28T23:25:15Z","snapshot_observed_at":"2026-07-06T17:27:29.050237Z","submitted_at":"2024-02-08T15:33:09Z","title":"Generalized Preference Optimization: A Unified Approach to Offline Alignment","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.05749","snapshot_observed_at":"2026-08-07T13:45:01.361604Z","title":"D., Zheng, Z., Calandriello, D., Munos, R., Rowland, M., Richemond, P","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21395","last_updated":"2025-05-27T16:23:24Z","snapshot_observed_at":"2026-08-07T13:26:21.678395Z","submitted_at":"2025-05-27T16:23:24Z","title":"Square$\\chi$PO: Differentially Private and Robust $\\chi^2$-Preference Optimization in Offline Direct Alignment","version":1},"reference_index":73,"source":"arxiv_source","source_observed_at":"2026-08-07T13:45:01.361604Z"},"links":{"cited_paper":"/paper/2402.05749","citing_paper":"/paper/2505.21395"},"observation_digest":"sha256:ad4fe17365d505f972d10319da368ffa82995b5a423975c7e6cf378f9832a2bc","observation_id":"31f00f59-19a3-4c2b-a2f4-8491679d2c76","resolution":{"observed_at":"2026-08-07T13:45:01.361604Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.05749","last_updated":"2024-05-28T23:25:15Z","snapshot_observed_at":"2026-07-06T17:27:29.050237Z","submitted_at":"2024-02-08T15:33:09Z","title":"Generalized Preference Optimization: A Unified Approach to Offline Alignment","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.05749","snapshot_observed_at":"2026-08-07T14:31:46.360499Z","title":"Generalized preference optimization: A unified approach to offline alignment","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21537","last_updated":"2025-05-24T09:07:13Z","snapshot_observed_at":"2026-08-08T02:37:32.325481Z","submitted_at":"2025-05-24T09:07:13Z","title":"OpenReview Should be Protected and Leveraged as a Community Asset for Research in the Era of Large Language Models","version":1},"reference_index":132,"source":"arxiv_source","source_observed_at":"2026-08-07T14:31:46.360499Z"},"links":{"cited_paper":"/paper/2402.05749","citing_paper":"/paper/2505.21537"},"observation_digest":"sha256:800978c95fdc097b2a13c0cceeea4aeaa4f8584e85a5ce5af7704da5d7980100","observation_id":"2e6ff718-c6fc-46f7-9aea-f0932bbcd6dd","resolution":{"observed_at":"2026-08-07T14:31:46.360499Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.05749","last_updated":"2024-05-28T23:25:15Z","snapshot_observed_at":"2026-07-06T17:27:29.050237Z","submitted_at":"2024-02-08T15:33:09Z","title":"Generalized Preference Optimization: A Unified Approach to Offline Alignment","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.05749","snapshot_observed_at":"2026-08-07T12:50:13.529395Z","title":"D., Zheng, Z., Calandriello, D., Munos, R., Rowland, M., Richemond, P","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.23557","last_updated":"2025-05-29T15:33:43Z","snapshot_observed_at":"2026-08-07T12:41:06.542814Z","submitted_at":"2025-05-29T15:33:43Z","title":"Learning Parametric Distributions from Samples and Preferences","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-07T12:50:13.529395Z"},"links":{"cited_paper":"/paper/2402.05749","citing_paper":"/paper/2505.23557"},"observation_digest":"sha256:9927b66f474550fc58d5f23120a895c9d88bad20d7dcf4338e713e27a7d05563","observation_id":"ba1dbab5-2129-42cb-9ed6-8fe0fa6d62b7","resolution":{"observed_at":"2026-08-07T12:50:13.529395Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.05749","last_updated":"2024-05-28T23:25:15Z","snapshot_observed_at":"2026-07-06T17:27:29.050237Z","submitted_at":"2024-02-08T15:33:09Z","title":"Generalized Preference Optimization: A Unified Approach to Offline Alignment","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.05749","snapshot_observed_at":"2026-08-07T12:27:56.555683Z","title":"Generalized preference optimization: A unified approach to offline alignment","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24709","last_updated":"2025-05-30T15:30:43Z","snapshot_observed_at":"2026-08-07T12:12:53.183544Z","submitted_at":"2025-05-30T15:30:43Z","title":"On Symmetric Losses for Robust Policy Optimization with Noisy Preferences","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T12:27:56.555683Z"},"links":{"cited_paper":"/paper/2402.05749","citing_paper":"/paper/2505.24709"},"observation_digest":"sha256:aea5f0915634407679b7830abfdb572655f9844fd16cf3b55d7fb5f44741aad0","observation_id":"21d8ba4c-9c58-46cc-b33b-f6537323faba","resolution":{"observed_at":"2026-08-07T12:27:56.555683Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.05749","last_updated":"2024-05-28T23:25:15Z","snapshot_observed_at":"2026-07-06T17:27:29.050237Z","submitted_at":"2024-02-08T15:33:09Z","title":"Generalized Preference Optimization: A Unified Approach to Offline Alignment","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.05749","snapshot_observed_at":"2026-08-07T05:40:18.016343Z","title":"D., Zheng, Z., Calandriello, D., Munos, R., Rowland, M., Richemond, P","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07492","last_updated":"2025-06-09T07:11:01Z","snapshot_observed_at":"2026-08-07T05:29:54.015791Z","submitted_at":"2025-06-09T07:11:01Z","title":"Explicit Preference Optimization: No Need for an Implicit Reward Model","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-07T05:40:18.016343Z"},"links":{"cited_paper":"/paper/2402.05749","citing_paper":"/paper/2506.07492"},"observation_digest":"sha256:e900a13da014a8221aaa43e1f30ec1ed52118e651a7c9dace4cbe33b334600e5","observation_id":"6bf9cade-a35f-49df-802a-f4f1d1c79197","resolution":{"observed_at":"2026-08-07T05:40:18.016343Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.05749","last_updated":"2024-05-28T23:25:15Z","snapshot_observed_at":"2026-07-06T17:27:29.050237Z","submitted_at":"2024-02-08T15:33:09Z","title":"Generalized Preference Optimization: A Unified Approach to Offline Alignment","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.05749","snapshot_observed_at":"2026-08-07T04:53:38.578236Z","title":"Generalized preference optimization: A unified approach to offline alignment","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.09477","last_updated":"2025-06-11T07:43:33Z","snapshot_observed_at":"2026-08-07T04:44:55.497491Z","submitted_at":"2025-06-11T07:43:33Z","title":"On a few pitfalls in KL divergence gradient estimation for RL","version":1},"reference_index":1999,"source":"pdf_text","source_observed_at":"2026-08-07T04:53:38.578236Z"},"links":{"cited_paper":"/paper/2402.05749","citing_paper":"/paper/2506.09477"},"observation_digest":"sha256:094c9c095c65db1cfdc8375add2ea5295d8579af5ab6960e67bcdd2d97730d5a","observation_id":"9fc43729-2309-44a1-b104-6dd6dd3a7ff4","resolution":{"observed_at":"2026-08-07T04:53:38.578236Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.05749","last_updated":"2024-05-28T23:25:15Z","snapshot_observed_at":"2026-07-06T17:27:29.050237Z","submitted_at":"2024-02-08T15:33:09Z","title":"Generalized Preference Optimization: A Unified Approach to Offline Alignment","version":2},"cited_work":{"arxiv_id":"2402.05749","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2402.05749","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"D., Zheng, Z., Calandriello, D., Munos, R., Rowland, M., Richemond, P","venue":null,"work_id":"06aa59f7-1662-4884-a7e5-971d50ed9fa1","year":2024},"citing_paper":{"arxiv_id":"2604.05341","last_updated":"2026-04-07T02:25:36Z","snapshot_observed_at":"2026-07-06T22:54:04.491386Z","submitted_at":"2026-04-07T02:25:36Z","title":"Curr-RLCER:Curriculum Reinforcement Learning For Coherence Explainable Recommendation","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-10T19:43:11.384787Z"},"links":{"cited_paper":"/paper/2402.05749","citing_paper":"/paper/2604.05341"},"observation_digest":"sha256:77de076f17f60a9fad3cc06749f522f40797636e6741394c10c22d80c90ed9a9","observation_id":"5f28af2f-0126-4227-86bd-402bdf9fda61","resolution":{"observed_at":"2026-05-10T22:35:49.941183Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.05749","last_updated":"2024-05-28T23:25:15Z","snapshot_observed_at":"2026-07-06T17:27:29.050237Z","submitted_at":"2024-02-08T15:33:09Z","title":"Generalized Preference Optimization: A Unified Approach to Offline Alignment","version":2},"cited_work":{"arxiv_id":"2402.05749","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2402.05749","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"D., Zheng, Z., Calandriello, D., Munos, R., Rowland, M., Richemond, P","venue":null,"work_id":"06aa59f7-1662-4884-a7e5-971d50ed9fa1","year":2024},"citing_paper":{"arxiv_id":"2605.06987","last_updated":"2026-05-07T22:05:23Z","snapshot_observed_at":"2026-07-31T05:30:22.249144Z","submitted_at":"2026-05-07T22:05:23Z","title":"Response Time Enhances Alignment with Heterogeneous Preferences","version":1},"reference_index":163,"source":"arxiv_source","source_observed_at":"2026-05-11T01:04:26.288913Z"},"links":{"cited_paper":"/paper/2402.05749","citing_paper":"/paper/2605.06987"},"observation_digest":"sha256:7f2074144d354a5745d6c4df80f12ba97aa353018163e8bd172d9853f982d28b","observation_id":"bfc0acf3-1e5c-4465-ba88-4d4026a4de31","resolution":{"observed_at":"2026-05-11T04:46:00.197978Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.05749","last_updated":"2024-05-28T23:25:15Z","snapshot_observed_at":"2026-07-06T17:27:29.050237Z","submitted_at":"2024-02-08T15:33:09Z","title":"Generalized Preference Optimization: A Unified Approach to Offline Alignment","version":2},"cited_work":{"arxiv_id":"2402.05749","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2402.05749","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"D., Zheng, Z., Calandriello, D., Munos, R., Rowland, M., Richemond, P","venue":null,"work_id":"06aa59f7-1662-4884-a7e5-971d50ed9fa1","year":2024},"citing_paper":{"arxiv_id":"2605.12288","last_updated":"2026-06-10T07:32:21Z","snapshot_observed_at":"2026-07-06T23:23:59.123377Z","submitted_at":"2026-05-12T15:44:33Z","title":"TokenRatio: Principled Token-Level Preference Optimization via Ratio Matching","version":1},"reference_index":139,"source":"arxiv_source","source_observed_at":"2026-05-13T04:55:55.013900Z"},"links":{"cited_paper":"/paper/2402.05749","citing_paper":"/paper/2605.12288"},"observation_digest":"sha256:6fa29ce8ca196df49732f1949bb0718227f7afad5ad55c69840cfce43837399d","observation_id":"1590a79e-fe7d-455b-b731-62dfdfc85523","resolution":{"observed_at":"2026-05-13T04:57:17.175932Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.05749","last_updated":"2024-05-28T23:25:15Z","snapshot_observed_at":"2026-07-06T17:27:29.050237Z","submitted_at":"2024-02-08T15:33:09Z","title":"Generalized Preference Optimization: A Unified Approach to Offline Alignment","version":2},"cited_work":{"arxiv_id":"2402.05749","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2402.05749","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"D., Zheng, Z., Calandriello, D., Munos, R., Rowland, M., Richemond, P","venue":null,"work_id":"06aa59f7-1662-4884-a7e5-971d50ed9fa1","year":2024},"citing_paper":{"arxiv_id":"2605.12288","last_updated":"2026-06-10T07:32:21Z","snapshot_observed_at":"2026-07-06T23:23:59.123377Z","submitted_at":"2026-05-12T15:44:33Z","title":"TokenRatio: Principled Token-Level Preference Optimization via Ratio Matching","version":2},"reference_index":139,"source":"arxiv_source","source_observed_at":"2026-05-15T05:41:10.714594Z"},"links":{"cited_paper":"/paper/2402.05749","citing_paper":"/paper/2605.12288"},"observation_digest":"sha256:681934b1562fec07ce716d9b895b687f3f55a461992a01ccf2cb322758aefde9","observation_id":"3b2bee7a-53ff-49ac-9411-5ca08a07456f","resolution":{"observed_at":"2026-05-15T05:45:06.522644Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.05749","last_updated":"2024-05-28T23:25:15Z","snapshot_observed_at":"2026-07-06T17:27:29.050237Z","submitted_at":"2024-02-08T15:33:09Z","title":"Generalized Preference Optimization: A Unified Approach to Offline Alignment","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.05749","snapshot_observed_at":"2026-07-11T13:53:36.775836Z","title":"arXiv preprint arXiv:2402.05749 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04763","last_updated":"2026-07-26T14:17:18Z","snapshot_observed_at":"2026-08-02T10:24:43.977557Z","submitted_at":"2026-07-06T07:56:53Z","title":"Multi-Turn On-Policy Distillation with Prefix Replay","version":1},"reference_index":190,"source":"arxiv_source","source_observed_at":"2026-07-11T13:53:36.775836Z"},"links":{"cited_paper":"/paper/2402.05749","citing_paper":"/paper/2607.04763"},"observation_digest":"sha256:6f66ef08329f0da044b9237fcdaa8a909da69095c4d9f7ff709d7018ecd25e26","observation_id":"f2eb89b7-8cf7-4aaa-be79-a61664a91d56","resolution":{"observed_at":"2026-07-11T13:53:36.775836Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.05749","last_updated":"2024-05-28T23:25:15Z","snapshot_observed_at":"2026-07-06T17:27:29.050237Z","submitted_at":"2024-02-08T15:33:09Z","title":"Generalized Preference Optimization: A Unified Approach to Offline Alignment","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.05749","snapshot_observed_at":"2026-08-02T08:40:54.675387Z","title":"arXiv preprint arXiv:2402.05749 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04763","last_updated":"2026-07-26T14:17:18Z","snapshot_observed_at":"2026-08-02T10:24:43.977557Z","submitted_at":"2026-07-06T07:56:53Z","title":"Multi-Turn On-Policy Distillation with Prefix Replay","version":3},"reference_index":191,"source":"arxiv_source","source_observed_at":"2026-08-02T08:40:54.675387Z"},"links":{"cited_paper":"/paper/2402.05749","citing_paper":"/paper/2607.04763"},"observation_digest":"sha256:7740557d945a40c2c57da1811b70a796a3ce1e8de14a4ee547b2b841ebbddfe6","observation_id":"0e16a44a-39cc-4b67-92e7-b47ce1f28de8","resolution":{"observed_at":"2026-08-02T08:40:54.675387Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.05749","last_updated":"2024-05-28T23:25:15Z","snapshot_observed_at":"2026-07-06T17:27:29.050237Z","submitted_at":"2024-02-08T15:33:09Z","title":"Generalized Preference Optimization: A Unified Approach to Offline Alignment","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.05749","snapshot_observed_at":"2026-08-02T10:01:58.919069Z","title":"D., Zheng, Z., Calandriello, D., Munos, R., Rowland, M., Richemond, P","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.16240","last_updated":"2026-06-26T03:03:15Z","snapshot_observed_at":"2026-08-08T01:20:34.619049Z","submitted_at":"2026-06-26T03:03:15Z","title":"Normalized Rewards for Preference Optimization","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-02T10:01:58.919069Z"},"links":{"cited_paper":"/paper/2402.05749","citing_paper":"/paper/2607.16240"},"observation_digest":"sha256:3cac0b68a70c644579f9c0d24774c1d9c071df50b8710980c7b5ee3f6b25374d","observation_id":"9cfa9a43-235a-4937-86fe-7ae51fa1af33","resolution":{"observed_at":"2026-08-02T10:01:58.919069Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.05749","last_updated":"2024-05-28T23:25:15Z","snapshot_observed_at":"2026-07-06T17:27:29.050237Z","submitted_at":"2024-02-08T15:33:09Z","title":"Generalized Preference Optimization: A Unified Approach to Offline Alignment","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.05749","snapshot_observed_at":"2026-08-01T07:28:28.247565Z","title":"arXiv preprint arXiv:2402.05749 , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.21453","last_updated":"2026-07-24T02:14:44Z","snapshot_observed_at":"2026-08-03T14:01:50.133228Z","submitted_at":"2026-07-23T15:55:29Z","title":"Test-Time Scaling via Error Localization","version":2},"reference_index":105,"source":"arxiv_source","source_observed_at":"2026-08-01T07:28:28.247565Z"},"links":{"cited_paper":"/paper/2402.05749","citing_paper":"/paper/2607.21453"},"observation_digest":"sha256:2a3e6014d58b946f309468bd133a51e39ae65d74fb8b78baecc0ecacaca656a9","observation_id":"d8a343d5-9c94-4a8b-b3da-b9f381382b9a","resolution":{"observed_at":"2026-08-01T07:28:28.247565Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2402.05749/citation-record","integrity":"/paper/2402.05749/integrity","json":"/paper/2402.05749/citation-record.json","paper":"/paper/2402.05749"},"outbound":[],"paper":{"arxiv_id":"2402.05749","last_updated":"2024-05-28T23:25:15Z","latest_version":2,"primary_category":"cs.LG","snapshot_observed_at":"2026-07-06T17:27:29.050237Z","submitted_at":"2024-02-08T15:33:09Z","title":"Generalized Preference Optimization: A Unified Approach to Offline Alignment"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 16 inbound Pith citation observations for arXiv:2402.05749."}