{"as_of":"2026-08-09T16:09:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:d7837ef0cebd92cf3af4504cf76925b8e2788186ba1b3fdb79ebfd2e2c6a242e","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":25,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":25,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":25,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":25,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-08T22:27:11.528056Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T06:49:37.721117Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2404.03715","last_updated":"2024-04-04T17:56:41Z","snapshot_observed_at":"2026-08-05T22:29:52.212015Z","submitted_at":"2024-04-04T17:56:41Z","title":"Direct Nash Optimization: Teaching Language Models to Self-Improve with General Preferences","version":1},"cited_work":{"arxiv_id":"2404.03715","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2404.03715","snapshot_observed_at":"2026-07-04T06:49:37.721117Z","title":"Direct nash optimization: Teaching language models to self-improve with general preferences","venue":null,"work_id":"09f0f49f-222e-4eaf-973e-a07f4bc8716e","year":2024},"citing_paper":{"arxiv_id":"2402.01306","last_updated":"2024-11-19T18:12:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-02-02T10:53:36Z","title":"KTO: Model Alignment as Prospect Theoretic Optimization","version":4},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-12T12:17:53.478052Z"},"links":{"cited_paper":"/paper/2404.03715","citing_paper":"/paper/2402.01306"},"observation_digest":"sha256:a8a6b71a76f0484e46e8d47f4244380086619be27f63f26026fd07f344515558","observation_id":"ff11211d-bc73-4838-908e-26f990d76380","resolution":{"observed_at":"2026-05-12T12:17:53.564060Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.03715","last_updated":"2024-04-04T17:56:41Z","snapshot_observed_at":"2026-08-05T22:29:52.212015Z","submitted_at":"2024-04-04T17:56:41Z","title":"Direct Nash Optimization: Teaching Language Models to Self-Improve with General Preferences","version":1},"cited_work":{"arxiv_id":"2404.03715","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2404.03715","snapshot_observed_at":"2026-07-04T06:49:37.721117Z","title":"Direct nash optimization: Teaching language models to self-improve with general preferences","venue":null,"work_id":"09f0f49f-222e-4eaf-973e-a07f4bc8716e","year":2024},"citing_paper":{"arxiv_id":"2409.12917","last_updated":"2024-10-04T17:28:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-19T17:16:21Z","title":"Training Language Models to Self-Correct via Reinforcement Learning","version":2},"reference_index":90,"source":"arxiv_source","source_observed_at":"2026-05-17T12:04:10.210508Z"},"links":{"cited_paper":"/paper/2404.03715","citing_paper":"/paper/2409.12917"},"observation_digest":"sha256:019a935c7bfd98942d2ae9d418b7e64f132667f2b42836f6fec403eeca4d52b3","observation_id":"35f6eb9c-ac9b-4b3f-858d-507259d3fdbb","resolution":{"observed_at":"2026-05-17T12:04:10.572479Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.03715","last_updated":"2024-04-04T17:56:41Z","snapshot_observed_at":"2026-08-05T22:29:52.212015Z","submitted_at":"2024-04-04T17:56:41Z","title":"Direct Nash Optimization: Teaching Language Models to Self-Improve with General Preferences","version":1},"cited_work":{"arxiv_id":"2404.03715","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2404.03715","snapshot_observed_at":"2026-07-04T06:49:37.721117Z","title":"Direct nash optimization: Teaching language models to self-improve with general preferences","venue":null,"work_id":"09f0f49f-222e-4eaf-973e-a07f4bc8716e","year":2024},"citing_paper":{"arxiv_id":"2502.01456","last_updated":"2025-09-26T09:25:31Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-03T15:43:48Z","title":"Process Reinforcement through Implicit Rewards","version":2},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-05-11T20:23:30.763794Z"},"links":{"cited_paper":"/paper/2404.03715","citing_paper":"/paper/2502.01456"},"observation_digest":"sha256:d8b7a128559826763377aeab12ba212ffcb79644e8d70d50abeee841744acce4","observation_id":"05481b0e-c6d2-4d15-9327-5f77272944cb","resolution":{"observed_at":"2026-05-11T20:23:31.113118Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.03715","last_updated":"2024-04-04T17:56:41Z","snapshot_observed_at":"2026-08-05T22:29:52.212015Z","submitted_at":"2024-04-04T17:56:41Z","title":"Direct Nash Optimization: Teaching Language Models to Self-Improve with General Preferences","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.03715","snapshot_observed_at":"2026-08-08T22:27:11.528056Z","title":"Direct nash optimization: Teaching language models to self-improve with general preferences","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.04567","last_updated":"2025-02-06T23:45:08Z","snapshot_observed_at":"2026-08-08T23:18:49.554514Z","submitted_at":"2025-02-06T23:45:08Z","title":"Preference Optimization via Contrastive Divergence: Your Reward Model is Secretly an NLL Estimator","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-08T22:27:11.528056Z"},"links":{"cited_paper":"/paper/2404.03715","citing_paper":"/paper/2502.04567"},"observation_digest":"sha256:b94dc3c8c1d016264bf8143d7644afb720930b46995acb71182b6c3e97648593","observation_id":"95964de6-65b9-4c72-a694-e5fa675a7a98","resolution":{"observed_at":"2026-08-08T22:27:11.528056Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.03715","last_updated":"2024-04-04T17:56:41Z","snapshot_observed_at":"2026-08-05T22:29:52.212015Z","submitted_at":"2024-04-04T17:56:41Z","title":"Direct Nash Optimization: Teaching Language Models to Self-Improve with General Preferences","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.03715","snapshot_observed_at":"2026-08-07T22:50:33.077519Z","title":"Direct nash optimization: Teaching language models to self-improve with general preferences","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.09053","last_updated":"2025-08-05T02:23:31Z","snapshot_observed_at":"2026-08-08T10:12:47.586452Z","submitted_at":"2025-02-13T08:08:27Z","title":"Game Theory Meets Large Language Models: A Systematic Survey with Taxonomy and New Frontiers","version":2},"reference_index":109,"source":"pdf_text","source_observed_at":"2026-08-07T22:50:33.077519Z"},"links":{"cited_paper":"/paper/2404.03715","citing_paper":"/paper/2502.09053"},"observation_digest":"sha256:800353952fd7fb04a935c147152454bd72985e71cf37be43040bf60ccc14b25c","observation_id":"3a9b81d3-fad4-400f-8a5b-9c988348fc5d","resolution":{"observed_at":"2026-08-07T22:50:33.077519Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.03715","last_updated":"2024-04-04T17:56:41Z","snapshot_observed_at":"2026-08-05T22:29:52.212015Z","submitted_at":"2024-04-04T17:56:41Z","title":"Direct Nash Optimization: Teaching Language Models to Self-Improve with General Preferences","version":1},"cited_work":{"arxiv_id":"2404.03715","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2404.03715","snapshot_observed_at":"2026-07-04T06:49:37.721117Z","title":"Direct nash optimization: Teaching language models to self-improve with general preferences","venue":null,"work_id":"09f0f49f-222e-4eaf-973e-a07f4bc8716e","year":2024},"citing_paper":{"arxiv_id":"2504.12501","last_updated":"2026-08-03T01:47:58Z","snapshot_observed_at":"2026-08-07T16:01:39.307745Z","submitted_at":"2025-04-16T21:36:46Z","title":"Reinforcement Learning from Human Feedback","version":9},"reference_index":205,"source":"pdf_text","source_observed_at":"2026-05-22T19:27:40.991325Z"},"links":{"cited_paper":"/paper/2404.03715","citing_paper":"/paper/2504.12501"},"observation_digest":"sha256:6596770d7c65b34afcc524d5d8b2f0281b4a046be5d5484f9ec63dd2406ef543","observation_id":"b9384154-a853-48d5-8e9e-5e44e46c2217","resolution":{"observed_at":"2026-05-22T19:32:01.386647Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.03715","last_updated":"2024-04-04T17:56:41Z","snapshot_observed_at":"2026-08-05T22:29:52.212015Z","submitted_at":"2024-04-04T17:56:41Z","title":"Direct Nash Optimization: Teaching Language Models to Self-Improve with General Preferences","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.03715","snapshot_observed_at":"2026-08-07T14:57:30.769929Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.16869","last_updated":"2025-05-22T16:24:51Z","snapshot_observed_at":"2026-08-09T02:24:14.170168Z","submitted_at":"2025-05-22T16:24:51Z","title":"MPO: Multilingual Safety Alignment via Reward Gap Optimization","version":1},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-07T14:57:30.769929Z"},"links":{"cited_paper":"/paper/2404.03715","citing_paper":"/paper/2505.16869"},"observation_digest":"sha256:3f8d17c74189c6a2f0a316c27af3ae5b22d4fb9e13a05f604ba3289052871467","observation_id":"c8df08d7-fa7c-40af-90c7-3558c8025d87","resolution":{"observed_at":"2026-08-07T14:57:30.769929Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.03715","last_updated":"2024-04-04T17:56:41Z","snapshot_observed_at":"2026-08-05T22:29:52.212015Z","submitted_at":"2024-04-04T17:56:41Z","title":"Direct Nash Optimization: Teaching Language Models to Self-Improve with General Preferences","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.03715","snapshot_observed_at":"2026-08-07T14:01:05.734257Z","title":"Direct nash optimization: Teaching language models to self-improve with general preferences","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.20556","last_updated":"2025-05-26T22:34:42Z","snapshot_observed_at":"2026-08-09T01:22:43.161220Z","submitted_at":"2025-05-26T22:34:42Z","title":"Learning a Pessimistic Reward Model in RLHF","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T14:01:05.734257Z"},"links":{"cited_paper":"/paper/2404.03715","citing_paper":"/paper/2505.20556"},"observation_digest":"sha256:1f34c96bcfe7f76f458fcfdd2fd127266a25da685241807c5d3ad7618da09cc4","observation_id":"cf583308-af18-4836-b38e-fa24ff026969","resolution":{"observed_at":"2026-08-07T14:01:05.734257Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.03715","last_updated":"2024-04-04T17:56:41Z","snapshot_observed_at":"2026-08-05T22:29:52.212015Z","submitted_at":"2024-04-04T17:56:41Z","title":"Direct Nash Optimization: Teaching Language Models to Self-Improve with General Preferences","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.03715","snapshot_observed_at":"2026-08-07T13:44:59.736916Z","title":"Direct Nash optimization: Teaching language models to self-improve with general preferences","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21395","last_updated":"2025-05-27T16:23:24Z","snapshot_observed_at":"2026-08-07T13:26:21.678395Z","submitted_at":"2025-05-27T16:23:24Z","title":"Square$\\chi$PO: Differentially Private and Robust $\\chi^2$-Preference Optimization in Offline Direct Alignment","version":1},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-08-07T13:44:59.736916Z"},"links":{"cited_paper":"/paper/2404.03715","citing_paper":"/paper/2505.21395"},"observation_digest":"sha256:85fc461b42164b0ea1bd85a97614cc885ffc1bc6f646872bf4cd65e9d74b5b57","observation_id":"2c612a59-241f-4f9b-a974-7f75e4c5f031","resolution":{"observed_at":"2026-08-07T13:44:59.736916Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.03715","last_updated":"2024-04-04T17:56:41Z","snapshot_observed_at":"2026-08-05T22:29:52.212015Z","submitted_at":"2024-04-04T17:56:41Z","title":"Direct Nash Optimization: Teaching Language Models to Self-Improve with General Preferences","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.03715","snapshot_observed_at":"2026-08-07T12:02:44.872410Z","title":"Direct nash optimization: Teaching language models to self-improve with general preferences","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.00845","last_updated":"2025-08-17T12:17:48Z","snapshot_observed_at":"2026-08-07T16:09:18.251031Z","submitted_at":"2025-06-01T05:39:56Z","title":"Generalizable LLM Learning of Graph Synthetic Data with Post-training Alignment","version":3},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-08-07T12:02:44.872410Z"},"links":{"cited_paper":"/paper/2404.03715","citing_paper":"/paper/2506.00845"},"observation_digest":"sha256:cd8e15031c50f434a0b1aa60dc21a9cb2ebf912a654a42e820eadebcd0b85986","observation_id":"1b6b2cad-3767-4e73-9981-da4ba7c71a92","resolution":{"observed_at":"2026-08-07T12:02:44.872410Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.03715","last_updated":"2024-04-04T17:56:41Z","snapshot_observed_at":"2026-08-05T22:29:52.212015Z","submitted_at":"2024-04-04T17:56:41Z","title":"Direct Nash Optimization: Teaching Language Models to Self-Improve with General Preferences","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.03715","snapshot_observed_at":"2026-08-07T11:20:14.109193Z","title":"Direct nash optimization: Teaching language models to self-improve with general preferences","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03066","last_updated":"2026-07-17T19:03:49Z","snapshot_observed_at":"2026-08-07T11:06:58.974594Z","submitted_at":"2025-06-03T16:42:39Z","title":"Sign-SZPO: Provable Preference-based Reinforcement Learning with an Unknown Link Function","version":2},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-08-07T11:20:14.109193Z"},"links":{"cited_paper":"/paper/2404.03715","citing_paper":"/paper/2506.03066"},"observation_digest":"sha256:729859cbe728d14deee32f8998844af7a442973d4f224ad309678d8995f20c1e","observation_id":"e7f15eb2-1f01-4a41-b31c-5f4fe31cdcbc","resolution":{"observed_at":"2026-08-07T11:20:14.109193Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.03715","last_updated":"2024-04-04T17:56:41Z","snapshot_observed_at":"2026-08-05T22:29:52.212015Z","submitted_at":"2024-04-04T17:56:41Z","title":"Direct Nash Optimization: Teaching Language Models to Self-Improve with General Preferences","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.03715","snapshot_observed_at":"2026-08-07T06:05:32.672178Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.11098","last_updated":"2025-06-06T13:19:07Z","snapshot_observed_at":"2026-08-08T09:29:26.176523Z","submitted_at":"2025-06-06T13:19:07Z","title":"Debiasing Online Preference Learning via Preference Feature Preservation","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-07T06:05:32.672178Z"},"links":{"cited_paper":"/paper/2404.03715","citing_paper":"/paper/2506.11098"},"observation_digest":"sha256:502789769870a667c367151c6bac678a659ec391ee655cc78e5cfbf228e10b95","observation_id":"0fc2bec0-5495-40c1-a5e9-18cfb280fb3c","resolution":{"observed_at":"2026-08-07T06:05:32.672178Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.03715","last_updated":"2024-04-04T17:56:41Z","snapshot_observed_at":"2026-08-05T22:29:52.212015Z","submitted_at":"2024-04-04T17:56:41Z","title":"Direct Nash Optimization: Teaching Language Models to Self-Improve with General Preferences","version":1},"cited_work":{"arxiv_id":"2404.03715","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2404.03715","snapshot_observed_at":"2026-07-04T06:49:37.721117Z","title":"Direct nash optimization: Teaching language models to self-improve with general preferences","venue":null,"work_id":"09f0f49f-222e-4eaf-973e-a07f4bc8716e","year":2024},"citing_paper":{"arxiv_id":"2509.23102","last_updated":"2026-04-06T19:14:12Z","snapshot_observed_at":"2026-08-03T06:33:00.420621Z","submitted_at":"2025-09-27T04:18:33Z","title":"Multiplayer Nash Preference Optimization","version":3},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-18T13:09:54.433720Z"},"links":{"cited_paper":"/paper/2404.03715","citing_paper":"/paper/2509.23102"},"observation_digest":"sha256:22551a01fe69e7a6f3ac908dc01bf151b04a1f39963c76e5c0607c862a6e8a94","observation_id":"4bbf2b40-5962-4839-b7d1-094cdec1c94d","resolution":{"observed_at":"2026-05-18T13:11:23.944650Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.03715","last_updated":"2024-04-04T17:56:41Z","snapshot_observed_at":"2026-08-05T22:29:52.212015Z","submitted_at":"2024-04-04T17:56:41Z","title":"Direct Nash Optimization: Teaching Language Models to Self-Improve with General Preferences","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.03715","snapshot_observed_at":"2026-08-03T13:42:06.117000Z","title":"Di- rect preference optimization: Your language model is secretly a reward model","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2512.23816","last_updated":"2026-06-25T06:56:14Z","snapshot_observed_at":"2026-08-06T05:05:37.952259Z","submitted_at":"2025-12-29T19:20:35Z","title":"Improved Bounds for Private and Robust Alignment","version":2},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-03T13:42:06.117000Z"},"links":{"cited_paper":"/paper/2404.03715","citing_paper":"/paper/2512.23816"},"observation_digest":"sha256:bbf22934fda33dfba0b6fb9a7cf2c133ff39a173dc5a880f3f4ea41174fb93c3","observation_id":"375fda13-12d7-495a-ac33-4357f018d7f5","resolution":{"observed_at":"2026-08-03T13:42:06.117000Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.03715","last_updated":"2024-04-04T17:56:41Z","snapshot_observed_at":"2026-08-05T22:29:52.212015Z","submitted_at":"2024-04-04T17:56:41Z","title":"Direct Nash Optimization: Teaching Language Models to Self-Improve with General Preferences","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.03715","snapshot_observed_at":"2026-08-03T06:06:23.730311Z","title":"Direct nash optimization: Teaching language models to self-improve with general preferences.arXiv preprint arXiv:2404.03715,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.02572","last_updated":"2026-06-07T17:10:20Z","snapshot_observed_at":"2026-08-05T00:08:42.424141Z","submitted_at":"2026-01-31T05:45:51Z","title":"Reward Shaping for (Inference-Time) Alignment: A Stackelberg Game Perspective","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-03T06:06:23.730311Z"},"links":{"cited_paper":"/paper/2404.03715","citing_paper":"/paper/2602.02572"},"observation_digest":"sha256:1eb3931b3c2b6dee6edf4270f86ae4714e7baf06552f84fe75273327b48f6a21","observation_id":"f59d078f-612b-4b29-96c8-2b6e0079f15a","resolution":{"observed_at":"2026-08-03T06:06:23.730311Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.03715","last_updated":"2024-04-04T17:56:41Z","snapshot_observed_at":"2026-08-05T22:29:52.212015Z","submitted_at":"2024-04-04T17:56:41Z","title":"Direct Nash Optimization: Teaching Language Models to Self-Improve with General Preferences","version":1},"cited_work":{"arxiv_id":"2404.03715","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2404.03715","snapshot_observed_at":"2026-07-04T06:49:37.721117Z","title":"Direct nash optimization: Teaching language models to self-improve with general preferences","venue":null,"work_id":"09f0f49f-222e-4eaf-973e-a07f4bc8716e","year":2024},"citing_paper":{"arxiv_id":"2604.17501","last_updated":"2026-04-19T15:43:20Z","snapshot_observed_at":"2026-07-06T23:04:37.370465Z","submitted_at":"2026-04-19T15:43:20Z","title":"CoAct: Co-Active LLM Preference Learning with Human-AI Synergy","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-10T05:26:18.163720Z"},"links":{"cited_paper":"/paper/2404.03715","citing_paper":"/paper/2604.17501"},"observation_digest":"sha256:5beb0539b90c0ea6a11bc748ff7cf0895eb284f63892293c2cdcc6dc0d1d3510","observation_id":"13f26489-4421-4416-a739-9397259589c6","resolution":{"observed_at":"2026-05-10T07:01:49.584601Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.03715","last_updated":"2024-04-04T17:56:41Z","snapshot_observed_at":"2026-08-05T22:29:52.212015Z","submitted_at":"2024-04-04T17:56:41Z","title":"Direct Nash Optimization: Teaching Language Models to Self-Improve with General Preferences","version":1},"cited_work":{"arxiv_id":"2404.03715","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2404.03715","snapshot_observed_at":"2026-07-04T06:49:37.721117Z","title":"Direct nash optimization: Teaching language models to self-improve with general preferences","venue":null,"work_id":"09f0f49f-222e-4eaf-973e-a07f4bc8716e","year":2024},"citing_paper":{"arxiv_id":"2605.09214","last_updated":"2026-05-09T23:17:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-09T23:17:46Z","title":"Fast Rates for Offline Contextual Bandits with Forward-KL Regularization under Single-Policy Concentrability","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-05-12T03:47:14.379908Z"},"links":{"cited_paper":"/paper/2404.03715","citing_paper":"/paper/2605.09214"},"observation_digest":"sha256:aff4f4dd4728748a3ef098743ca6e66adcdff6590783c637ac41eefe29d12353","observation_id":"b200f40d-5da8-47c7-b62e-11bdda45921e","resolution":{"observed_at":"2026-05-12T06:56:30.887352Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.03715","last_updated":"2024-04-04T17:56:41Z","snapshot_observed_at":"2026-08-05T22:29:52.212015Z","submitted_at":"2024-04-04T17:56:41Z","title":"Direct Nash Optimization: Teaching Language Models to Self-Improve with General Preferences","version":1},"cited_work":{"arxiv_id":"2404.03715","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2404.03715","snapshot_observed_at":"2026-07-04T06:49:37.721117Z","title":"Direct nash optimization: Teaching language models to self-improve with general preferences","venue":null,"work_id":"09f0f49f-222e-4eaf-973e-a07f4bc8716e","year":2024},"citing_paper":{"arxiv_id":"2605.12288","last_updated":"2026-06-10T07:32:21Z","snapshot_observed_at":"2026-07-06T23:23:59.123377Z","submitted_at":"2026-05-12T15:44:33Z","title":"TokenRatio: Principled Token-Level Preference Optimization via Ratio Matching","version":1},"reference_index":154,"source":"arxiv_source","source_observed_at":"2026-05-13T04:55:55.013900Z"},"links":{"cited_paper":"/paper/2404.03715","citing_paper":"/paper/2605.12288"},"observation_digest":"sha256:7757005d79124eba880292fea03c1d01e6dc9d1f032a9b082fb4b3af79cbc8e4","observation_id":"5d79cd9f-3635-4db2-96a7-9fdd7e45ab3b","resolution":{"observed_at":"2026-05-13T04:57:17.354453Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.03715","last_updated":"2024-04-04T17:56:41Z","snapshot_observed_at":"2026-08-05T22:29:52.212015Z","submitted_at":"2024-04-04T17:56:41Z","title":"Direct Nash Optimization: Teaching Language Models to Self-Improve with General Preferences","version":1},"cited_work":{"arxiv_id":"2404.03715","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2404.03715","snapshot_observed_at":"2026-07-04T06:49:37.721117Z","title":"Direct nash optimization: Teaching language models to self-improve with general preferences","venue":null,"work_id":"09f0f49f-222e-4eaf-973e-a07f4bc8716e","year":2024},"citing_paper":{"arxiv_id":"2605.12288","last_updated":"2026-06-10T07:32:21Z","snapshot_observed_at":"2026-07-06T23:23:59.123377Z","submitted_at":"2026-05-12T15:44:33Z","title":"TokenRatio: Principled Token-Level Preference Optimization via Ratio Matching","version":2},"reference_index":154,"source":"arxiv_source","source_observed_at":"2026-05-15T05:41:10.714594Z"},"links":{"cited_paper":"/paper/2404.03715","citing_paper":"/paper/2605.12288"},"observation_digest":"sha256:2a35c2d7699d206a48ed4c256fa39abb8a90078b1613d29522288071ea519a19","observation_id":"a65fb4dd-ff9b-4306-8680-9a32351a9c0b","resolution":{"observed_at":"2026-05-15T05:45:06.654565Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.03715","last_updated":"2024-04-04T17:56:41Z","snapshot_observed_at":"2026-08-05T22:29:52.212015Z","submitted_at":"2024-04-04T17:56:41Z","title":"Direct Nash Optimization: Teaching Language Models to Self-Improve with General Preferences","version":1},"cited_work":{"arxiv_id":"2404.03715","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2404.03715","snapshot_observed_at":"2026-07-04T06:49:37.721117Z","title":"Direct nash optimization: Teaching language models to self-improve with general preferences","venue":null,"work_id":"09f0f49f-222e-4eaf-973e-a07f4bc8716e","year":2024},"citing_paper":{"arxiv_id":"2605.13875","last_updated":"2026-05-08T06:56:35Z","snapshot_observed_at":"2026-08-02T22:27:33.584660Z","submitted_at":"2026-05-08T06:56:35Z","title":"Common-agency Games for Multi-Objective Test-Time Alignment","version":1},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-05-15T06:14:53.685486Z"},"links":{"cited_paper":"/paper/2404.03715","citing_paper":"/paper/2605.13875"},"observation_digest":"sha256:1a09693cd0a3e3405da9f585e9a9baed3a130d67e69d5a3efc1b5191b93b8ca0","observation_id":"454872d7-679a-46f8-baa3-63fe12fbeb02","resolution":{"observed_at":"2026-05-15T06:15:06.588171Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.03715","last_updated":"2024-04-04T17:56:41Z","snapshot_observed_at":"2026-08-05T22:29:52.212015Z","submitted_at":"2024-04-04T17:56:41Z","title":"Direct Nash Optimization: Teaching Language Models to Self-Improve with General Preferences","version":1},"cited_work":{"arxiv_id":"2404.03715","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2404.03715","snapshot_observed_at":"2026-07-04T06:49:37.721117Z","title":"Direct nash optimization: Teaching language models to self-improve with general preferences","venue":null,"work_id":"09f0f49f-222e-4eaf-973e-a07f4bc8716e","year":2024},"citing_paper":{"arxiv_id":"2605.15113","last_updated":"2026-05-18T19:19:17Z","snapshot_observed_at":"2026-07-06T23:26:28.006734Z","submitted_at":"2026-05-14T17:27:34Z","title":"Learning from Language Feedback via Variational Policy Distillation","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-20T20:34:36.764090Z"},"links":{"cited_paper":"/paper/2404.03715","citing_paper":"/paper/2605.15113"},"observation_digest":"sha256:c6c704e07e02369b0645ec48e98615f26ae70ae21db15f26817faa7c4a86c990","observation_id":"160f2efb-8f9e-48a8-9cb4-0241ff246eda","resolution":{"observed_at":"2026-05-20T20:39:00.287412Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.03715","last_updated":"2024-04-04T17:56:41Z","snapshot_observed_at":"2026-08-05T22:29:52.212015Z","submitted_at":"2024-04-04T17:56:41Z","title":"Direct Nash Optimization: Teaching Language Models to Self-Improve with General Preferences","version":1},"cited_work":{"arxiv_id":"2404.03715","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2404.03715","snapshot_observed_at":"2026-07-04T06:49:37.721117Z","title":"Direct nash optimization: Teaching language models to self-improve with general preferences","venue":null,"work_id":"09f0f49f-222e-4eaf-973e-a07f4bc8716e","year":2024},"citing_paper":{"arxiv_id":"2605.17342","last_updated":"2026-05-17T09:27:26Z","snapshot_observed_at":"2026-08-02T08:43:29.718077Z","submitted_at":"2026-05-17T09:27:26Z","title":"Transitivity Meets Cyclicity: Explicit Preference Decomposition for Dynamic Large Language Model Alignment","version":1},"reference_index":91,"source":"arxiv_source","source_observed_at":"2026-05-20T14:26:06.428076Z"},"links":{"cited_paper":"/paper/2404.03715","citing_paper":"/paper/2605.17342"},"observation_digest":"sha256:ff79b4684199066cb7cc092fe7221f43b57630b127ecb664241017a4f5183d39","observation_id":"eed979e2-bcfc-4804-a09e-539e2e4fa576","resolution":{"observed_at":"2026-05-20T14:28:21.293961Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.03715","last_updated":"2024-04-04T17:56:41Z","snapshot_observed_at":"2026-08-05T22:29:52.212015Z","submitted_at":"2024-04-04T17:56:41Z","title":"Direct Nash Optimization: Teaching Language Models to Self-Improve with General Preferences","version":1},"cited_work":{"arxiv_id":"2404.03715","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2404.03715","snapshot_observed_at":"2026-07-04T06:49:37.721117Z","title":"Direct nash optimization: Teaching language models to self-improve with general preferences","venue":null,"work_id":"09f0f49f-222e-4eaf-973e-a07f4bc8716e","year":2024},"citing_paper":{"arxiv_id":"2606.01561","last_updated":"2026-06-01T02:06:58Z","snapshot_observed_at":"2026-08-01T20:22:50.507895Z","submitted_at":"2026-06-01T02:06:58Z","title":"S-SPPO: Semantic-Calibrated Self-Play Preference Optimization","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-06-28T14:58:33.167891Z"},"links":{"cited_paper":"/paper/2404.03715","citing_paper":"/paper/2606.01561"},"observation_digest":"sha256:22cbacc6ca02a6c47e23d2ecc059428b6c159ad8f7cda851d3f58e2ab68f054c","observation_id":"39657248-29cf-426c-9954-0c4cfe4a1083","resolution":{"observed_at":"2026-07-01T22:56:19.406664Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.03715","last_updated":"2024-04-04T17:56:41Z","snapshot_observed_at":"2026-08-05T22:29:52.212015Z","submitted_at":"2024-04-04T17:56:41Z","title":"Direct Nash Optimization: Teaching Language Models to Self-Improve with General Preferences","version":1},"cited_work":{"arxiv_id":"2404.03715","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2404.03715","snapshot_observed_at":"2026-07-04T06:49:37.721117Z","title":"Direct nash optimization: Teaching language models to self-improve with general preferences","venue":null,"work_id":"09f0f49f-222e-4eaf-973e-a07f4bc8716e","year":2024},"citing_paper":{"arxiv_id":"2606.03489","last_updated":"2026-06-02T11:07:20Z","snapshot_observed_at":"2026-07-06T23:43:46.458792Z","submitted_at":"2026-06-02T11:07:20Z","title":"Learn from Your Mistakes: Tree-like Self-Play for Secure Code LLMs","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-06-28T09:40:35.258818Z"},"links":{"cited_paper":"/paper/2404.03715","citing_paper":"/paper/2606.03489"},"observation_digest":"sha256:29d37363d7226471fe4f26cf7897dde52b80bed21d2864ab22cb0d4d0a075073","observation_id":"8a86bec4-31c5-4500-aca5-98e5479967fc","resolution":{"observed_at":"2026-07-02T03:46:33.121702Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.03715","last_updated":"2024-04-04T17:56:41Z","snapshot_observed_at":"2026-08-05T22:29:52.212015Z","submitted_at":"2024-04-04T17:56:41Z","title":"Direct Nash Optimization: Teaching Language Models to Self-Improve with General Preferences","version":1},"cited_work":{"arxiv_id":"2404.03715","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2404.03715","snapshot_observed_at":"2026-07-04T06:49:37.721117Z","title":"Direct nash optimization: Teaching language models to self-improve with general preferences","venue":null,"work_id":"09f0f49f-222e-4eaf-973e-a07f4bc8716e","year":2024},"citing_paper":{"arxiv_id":"2606.21550","last_updated":"2026-06-19T15:47:01Z","snapshot_observed_at":"2026-08-08T02:38:40.288019Z","submitted_at":"2026-06-19T15:47:01Z","title":"AI Alignment From Social Choice Perspectives","version":1},"reference_index":112,"source":"pdf_text","source_observed_at":"2026-06-26T14:12:36.892697Z"},"links":{"cited_paper":"/paper/2404.03715","citing_paper":"/paper/2606.21550"},"observation_digest":"sha256:173476556c0752552d036f72d327c42c9b0230528c2be7ba8f01f5ecad82bc15","observation_id":"8af116e8-2e4a-4849-8af6-03779b44affc","resolution":{"observed_at":"2026-07-04T06:49:37.723384Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2404.03715/citation-record","integrity":"/paper/2404.03715/integrity","json":"/paper/2404.03715/citation-record.json","paper":"/paper/2404.03715"},"outbound":[],"paper":{"arxiv_id":"2404.03715","last_updated":"2024-04-04T17:56:41Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-05T22:29:52.212015Z","submitted_at":"2024-04-04T17:56:41Z","title":"Direct Nash Optimization: Teaching Language Models to Self-Improve with General Preferences"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 25 inbound Pith citation observations for arXiv:2404.03715."}