{"as_of":"2026-08-11T10:06:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:9c9f38f71b12016e4cbeab1bdd67fccc447377dd7bd79c813d18e4e9eeccc91d","coverage":[{"denominator":21,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":21,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-10T14:39:22.659889Z","state":"measured"},{"denominator":21,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":21,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-11T06:34:44.6726+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2501.15109/citation-record","integrity":"/paper/2501.15109/integrity","json":"/paper/2501.15109/citation-record.json","paper":"/paper/2501.15109"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2305.14233","last_updated":"2023-05-23T16:49:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-05-23T16:49:14Z","title":"Enhancing Chat Language Models by Scaling High-quality Instructional Conversations","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.14233","snapshot_observed_at":"2026-08-10T14:39:22.570129Z","title":"arXiv preprint arXiv:2305.14233","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.15109","last_updated":"2025-01-25T07:21:50Z","snapshot_observed_at":"2026-08-10T21:52:15.934248Z","submitted_at":"2025-01-25T07:21:50Z","title":"Clear Preferences Leave Traces: Reference Model-Guided Sampling for Preference Learning","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-10T14:39:22.570129Z"},"links":{"cited_paper":"/paper/2305.14233","citing_paper":"/paper/2501.15109"},"observation_digest":"sha256:cfbb487ec20d56c03aa2a16b5353b0eeb34af895ac60f5037c958029e2aadaff","observation_id":"4cb1b3ab-7199-469d-8200-1ade5491316f","resolution":{"observed_at":"2026-08-10T14:39:22.570129Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-10T16:40:37.411115Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-10T14:39:22.575009Z","title":"arXiv preprint arXiv:2407.21783","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.15109","last_updated":"2025-01-25T07:21:50Z","snapshot_observed_at":"2026-08-10T21:52:15.934248Z","submitted_at":"2025-01-25T07:21:50Z","title":"Clear Preferences Leave Traces: Reference Model-Guided Sampling for Preference Learning","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-10T14:39:22.575009Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2501.15109"},"observation_digest":"sha256:8714bb3be954dcded76ba8470e5e389e475f0192e4a60145b0240b748748730b","observation_id":"e204ea03-bab1-452c-9ab4-91cbacbf35f0","resolution":{"observed_at":"2026-08-10T14:39:22.575009Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.01306","last_updated":"2024-11-19T18:12:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-02-02T10:53:36Z","title":"KTO: Model Alignment as Prospect Theoretic Optimization","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.01306","snapshot_observed_at":"2026-08-10T14:39:22.580488Z","title":"arXiv preprint arXiv:2402.01306","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.15109","last_updated":"2025-01-25T07:21:50Z","snapshot_observed_at":"2026-08-10T21:52:15.934248Z","submitted_at":"2025-01-25T07:21:50Z","title":"Clear Preferences Leave Traces: Reference Model-Guided Sampling for Preference Learning","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-10T14:39:22.580488Z"},"links":{"cited_paper":"/paper/2402.01306","citing_paper":"/paper/2501.15109"},"observation_digest":"sha256:c81c9a58906ba770d30b8a43301e0b68bdb26871c20dd57235fa1264a9909abd","observation_id":"12b3a973-da04-4eee-9de3-ba597e5fcc34","resolution":{"observed_at":"2026-08-10T14:39:22.580488Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.09824","last_updated":"2024-04-15T14:21:53Z","snapshot_observed_at":"2026-08-10T03:27:00.084983Z","submitted_at":"2024-04-15T14:21:53Z","title":"Impact of Preference Noise on the Alignment Performance of Generative Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.09824","snapshot_observed_at":"2026-08-10T14:39:22.585488Z","title":"arXiv preprint arXiv:2404.09824","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.15109","last_updated":"2025-01-25T07:21:50Z","snapshot_observed_at":"2026-08-10T21:52:15.934248Z","submitted_at":"2025-01-25T07:21:50Z","title":"Clear Preferences Leave Traces: Reference Model-Guided Sampling for Preference Learning","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-10T14:39:22.585488Z"},"links":{"cited_paper":"/paper/2404.09824","citing_paper":"/paper/2501.15109"},"observation_digest":"sha256:ac67226b5d87f7ff70bd83446fa7f961048d9d9c54a53c499687065a5e5b53cf","observation_id":"778039a5-bf25-4cb2-a026-57d5f990d648","resolution":{"observed_at":"2026-08-10T14:39:22.585488Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16486","last_updated":"2024-06-24T09:40:39Z","snapshot_observed_at":"2026-08-11T08:27:48.387195Z","submitted_at":"2024-06-24T09:40:39Z","title":"Towards Comprehensive Preference Data Collection for Reward Modeling","version":1},"cited_work":{"arxiv_id":"2406.16486","doi":null,"metadata_source":"pith","pith_arxiv_id":"2406.16486","snapshot_observed_at":"2026-08-10T14:39:22.881584Z","title":"Towards Comprehensive Preference Data Collection for Reward Modeling","venue":"cs.AI","work_id":"52b9a5c3-4b72-4599-8276-91d993438cef","year":2024},"citing_paper":{"arxiv_id":"2501.15109","last_updated":"2025-01-25T07:21:50Z","snapshot_observed_at":"2026-08-10T21:52:15.934248Z","submitted_at":"2025-01-25T07:21:50Z","title":"Clear Preferences Leave Traces: Reference Model-Guided Sampling for Preference Learning","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-10T14:39:22.591220Z"},"links":{"cited_paper":"/paper/2406.16486","citing_paper":"/paper/2501.15109"},"observation_digest":"sha256:2fb003af2bdb798677f242067455be6c5f8cfd06af449e830a18fb3de8379f0e","observation_id":"96893a3d-cb9f-4d0f-8f3b-37b860da39a1","resolution":{"observed_at":"2026-08-10T14:39:22.888258Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:39:22.983385Z","title":"In Proceedings of the 2023 Conference on Em- pirical Methods in Natural Language Processing , 9187–","venue":null,"work_id":"0ede931e-a5f1-43d2-9ae4-067d0b7d7823","year":2023},"citing_paper":{"arxiv_id":"2501.15109","last_updated":"2025-01-25T07:21:50Z","snapshot_observed_at":"2026-08-10T21:52:15.934248Z","submitted_at":"2025-01-25T07:21:50Z","title":"Clear Preferences Leave Traces: Reference Model-Guided Sampling for Preference Learning","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-10T14:39:22.596666Z"},"links":{"citing_paper":"/paper/2501.15109"},"observation_digest":"sha256:4f89d95f0702961f0d5612b190432e89f9f306c8f87b97a4b93951fa9af82af8","observation_id":"eb394745-d226-4486-8f3d-34dce92d2ff2","resolution":{"observed_at":"2026-08-10T14:39:22.988101Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.19544","last_updated":"2024-11-22T05:55:58Z","snapshot_observed_at":"2026-07-06T18:22:18.644161Z","submitted_at":"2024-05-29T22:12:52Z","title":"One-Shot Safety Alignment for Large Language Models via Optimal Dualization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.19544","snapshot_observed_at":"2026-08-10T14:39:22.601279Z","title":"arXiv preprint arXiv:2405.19544","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.15109","last_updated":"2025-01-25T07:21:50Z","snapshot_observed_at":"2026-08-10T21:52:15.934248Z","submitted_at":"2025-01-25T07:21:50Z","title":"Clear Preferences Leave Traces: Reference Model-Guided Sampling for Preference Learning","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-10T14:39:22.601279Z"},"links":{"cited_paper":"/paper/2405.19544","citing_paper":"/paper/2501.15109"},"observation_digest":"sha256:ee5847e3f5acab5f1b246f640e83bf98d071dc9fc57440072f487749df29b8b0","observation_id":"6374e27e-381f-473f-b62b-d321476f14b0","resolution":{"observed_at":"2026-08-10T14:39:22.601279Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09279","last_updated":"2024-10-07T21:24:59Z","snapshot_observed_at":"2026-07-06T18:30:28.421247Z","submitted_at":"2024-06-13T16:17:21Z","title":"Unpacking DPO and PPO: Disentangling Best Practices for Learning from Preference Feedback","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.09279","snapshot_observed_at":"2026-08-10T14:39:22.605842Z","title":"arXiv preprint arXiv:2406.09279","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.15109","last_updated":"2025-01-25T07:21:50Z","snapshot_observed_at":"2026-08-10T21:52:15.934248Z","submitted_at":"2025-01-25T07:21:50Z","title":"Clear Preferences Leave Traces: Reference Model-Guided Sampling for Preference Learning","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-10T14:39:22.605842Z"},"links":{"cited_paper":"/paper/2406.09279","citing_paper":"/paper/2501.15109"},"observation_digest":"sha256:24263bad2473509604d462971c42c52ad66b522987182a374b2c84be31aa8f59","observation_id":"bd44d406-4f46-49e3-be8d-c303673f55ad","resolution":{"observed_at":"2026-08-10T14:39:22.605842Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06825","last_updated":"2023-10-10T17:54:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-10T17:54:58Z","title":"Mistral 7B","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06825","snapshot_observed_at":"2026-08-10T14:39:22.610940Z","title":"arXiv preprint arXiv:2310.06825","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.15109","last_updated":"2025-01-25T07:21:50Z","snapshot_observed_at":"2026-08-10T21:52:15.934248Z","submitted_at":"2025-01-25T07:21:50Z","title":"Clear Preferences Leave Traces: Reference Model-Guided Sampling for Preference Learning","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-10T14:39:22.610940Z"},"links":{"cited_paper":"/paper/2310.06825","citing_paper":"/paper/2501.15109"},"observation_digest":"sha256:e04853abfc8b212dda1210ee8eccb7a15faf74c35978b9fffaa3baaa2233f545","observation_id":"d9f28792-0da2-4476-8710-094a050b3e65","resolution":{"observed_at":"2026-08-10T14:39:22.610940Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11191","last_updated":"2024-06-18T08:18:33Z","snapshot_observed_at":"2026-08-03T11:31:07.805515Z","submitted_at":"2024-06-17T03:52:51Z","title":"A Survey on Human Preference Learning for Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.11191","snapshot_observed_at":"2026-08-10T14:39:22.615302Z","title":"arXiv preprint arXiv:2406.11191","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.15109","last_updated":"2025-01-25T07:21:50Z","snapshot_observed_at":"2026-08-10T21:52:15.934248Z","submitted_at":"2025-01-25T07:21:50Z","title":"Clear Preferences Leave Traces: Reference Model-Guided Sampling for Preference Learning","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-10T14:39:22.615302Z"},"links":{"cited_paper":"/paper/2406.11191","citing_paper":"/paper/2501.15109"},"observation_digest":"sha256:2a711e308367f7393e2d20a54c5ebc63b5e8a37b0db98c5b5c03c5542b6b0153","observation_id":"5348c521-0ea4-4238-b262-f561f98c6ff4","resolution":{"observed_at":"2026-08-10T14:39:22.615302Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04412","last_updated":"2025-03-04T00:04:24Z","snapshot_observed_at":"2026-08-09T05:49:56.646876Z","submitted_at":"2024-06-06T18:01:02Z","title":"Spread Preference Annotation: Direct Preference Judgment for Efficient LLM Alignment","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.04412","snapshot_observed_at":"2026-08-10T14:39:22.620676Z","title":"arXiv preprint arXiv:2406.04412","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.15109","last_updated":"2025-01-25T07:21:50Z","snapshot_observed_at":"2026-08-10T21:52:15.934248Z","submitted_at":"2025-01-25T07:21:50Z","title":"Clear Preferences Leave Traces: Reference Model-Guided Sampling for Preference Learning","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-10T14:39:22.620676Z"},"links":{"cited_paper":"/paper/2406.04412","citing_paper":"/paper/2501.15109"},"observation_digest":"sha256:60185f06dbdf6c921e9f222d58d7920abfdac0c3c5a0203a087f52123fea7549","observation_id":"5a792d65-1c92-4d01-9816-18e06630e5f7","resolution":{"observed_at":"2026-08-10T14:39:22.620676Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11939","last_updated":"2024-10-14T18:11:58Z","snapshot_observed_at":"2026-08-11T09:34:38.920981Z","submitted_at":"2024-06-17T17:26:10Z","title":"From Crowdsourced Data to High-Quality Benchmarks: Arena-Hard and BenchBuilder Pipeline","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.11939","snapshot_observed_at":"2026-08-10T14:39:22.625907Z","title":"arXiv preprint arXiv:2406.11939","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.15109","last_updated":"2025-01-25T07:21:50Z","snapshot_observed_at":"2026-08-10T21:52:15.934248Z","submitted_at":"2025-01-25T07:21:50Z","title":"Clear Preferences Leave Traces: Reference Model-Guided Sampling for Preference Learning","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-10T14:39:22.625907Z"},"links":{"cited_paper":"/paper/2406.11939","citing_paper":"/paper/2501.15109"},"observation_digest":"sha256:aa05f05aef5408847ff0f130e7e9b4881105f1350fc039c037046124313c1152","observation_id":"624eec9c-f1d9-41f5-b2a7-b2eedc21ec2d","resolution":{"observed_at":"2026-08-10T14:39:22.625907Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.06657","last_updated":"2024-01-23T23:16:11Z","snapshot_observed_at":"2026-08-10T21:51:54.603545Z","submitted_at":"2023-09-13T01:07:25Z","title":"Statistical Rejection Sampling Improves Preference Optimization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.06657","snapshot_observed_at":"2026-08-10T14:39:22.630705Z","title":"arXiv preprint arXiv:2309.06657","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.15109","last_updated":"2025-01-25T07:21:50Z","snapshot_observed_at":"2026-08-10T21:52:15.934248Z","submitted_at":"2025-01-25T07:21:50Z","title":"Clear Preferences Leave Traces: Reference Model-Guided Sampling for Preference Learning","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-10T14:39:22.630705Z"},"links":{"cited_paper":"/paper/2309.06657","citing_paper":"/paper/2501.15109"},"observation_digest":"sha256:a786adc684da9ef286549f8e97e1b5be29d6e5c8c6a88851a5b5f2a7d9509a81","observation_id":"3d3bb5d8-2270-436a-ab72-33a6e358a940","resolution":{"observed_at":"2026-08-10T14:39:22.630705Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.02475","last_updated":"2024-03-04T20:39:24Z","snapshot_observed_at":"2026-08-08T15:03:18.474377Z","submitted_at":"2024-03-04T20:39:24Z","title":"Enhancing LLM Safety via Constrained Direct Preference Optimization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.02475","snapshot_observed_at":"2026-08-10T14:39:22.636132Z","title":"arXiv preprint arXiv:2403.02475","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.15109","last_updated":"2025-01-25T07:21:50Z","snapshot_observed_at":"2026-08-10T21:52:15.934248Z","submitted_at":"2025-01-25T07:21:50Z","title":"Clear Preferences Leave Traces: Reference Model-Guided Sampling for Preference Learning","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-10T14:39:22.636132Z"},"links":{"cited_paper":"/paper/2403.02475","citing_paper":"/paper/2501.15109"},"observation_digest":"sha256:f76382ad5a64857002eac4d83247897cd14a1d95ce94ed4f282af8d8be985eb4","observation_id":"df0fb837-b648-4b15-9f59-646e4f21287a","resolution":{"observed_at":"2026-08-10T14:39:22.636132Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.03400","last_updated":"2024-03-07T12:04:54Z","snapshot_observed_at":"2026-08-10T02:42:55.984513Z","submitted_at":"2023-10-05T09:09:44Z","title":"Adapting Large Language Models for Content Moderation: Pitfalls in Data Engineering and Supervised Fine-tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.03400","snapshot_observed_at":"2026-08-10T14:39:22.640623Z","title":"arXiv preprint arXiv:2310.03400","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.15109","last_updated":"2025-01-25T07:21:50Z","snapshot_observed_at":"2026-08-10T21:52:15.934248Z","submitted_at":"2025-01-25T07:21:50Z","title":"Clear Preferences Leave Traces: Reference Model-Guided Sampling for Preference Learning","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-10T14:39:22.640623Z"},"links":{"cited_paper":"/paper/2310.03400","citing_paper":"/paper/2501.15109"},"observation_digest":"sha256:0b1e57ddcd0f23c7155404fbff154af76b0c4949dd4a8871c49a2a89559bd130","observation_id":"8b442214-fe35-4712-80ef-f6a06e762b45","resolution":{"observed_at":"2026-08-10T14:39:22.640623Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.14734","last_updated":"2024-11-01T20:05:19Z","snapshot_observed_at":"2026-08-03T02:02:15.325394Z","submitted_at":"2024-05-23T16:01:46Z","title":"SimPO: Simple Preference Optimization with a Reference-Free Reward","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.14734","snapshot_observed_at":"2026-08-10T14:39:22.645558Z","title":"arXiv preprint arXiv:2405.14734","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.15109","last_updated":"2025-01-25T07:21:50Z","snapshot_observed_at":"2026-08-10T21:52:15.934248Z","submitted_at":"2025-01-25T07:21:50Z","title":"Clear Preferences Leave Traces: Reference Model-Guided Sampling for Preference Learning","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-10T14:39:22.645558Z"},"links":{"cited_paper":"/paper/2405.14734","citing_paper":"/paper/2501.15109"},"observation_digest":"sha256:cd6e2fd6a0adc8b7055a2b019fb2ef06eab807dafa3757c00daf7d743c15d5e2","observation_id":"d7dacf60-509c-4f74-a326-58e84b29d054","resolution":{"observed_at":"2026-08-10T14:39:22.645558Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.13846","last_updated":"2024-12-03T17:22:01Z","snapshot_observed_at":"2026-08-03T02:30:20.380179Z","submitted_at":"2024-04-22T03:05:19Z","title":"Filtered Direct Preference Optimization","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.13846","snapshot_observed_at":"2026-08-10T14:39:22.650320Z","title":"arXiv preprint arXiv:2404.13846","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.15109","last_updated":"2025-01-25T07:21:50Z","snapshot_observed_at":"2026-08-10T21:52:15.934248Z","submitted_at":"2025-01-25T07:21:50Z","title":"Clear Preferences Leave Traces: Reference Model-Guided Sampling for Preference Learning","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-10T14:39:22.650320Z"},"links":{"cited_paper":"/paper/2404.13846","citing_paper":"/paper/2501.15109"},"observation_digest":"sha256:9a1e9742812bda13c07ac1aff70904f54d857fa21cd758563a4e358d44d96970","observation_id":"c152b506-7f2b-42cf-8134-ac543e973363","resolution":{"observed_at":"2026-08-10T14:39:22.650320Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.13228","last_updated":"2024-07-03T13:46:33Z","snapshot_observed_at":"2026-08-08T16:03:10.053914Z","submitted_at":"2024-02-20T18:42:34Z","title":"Smaug: Fixing Failure Modes of Preference Optimisation with DPO-Positive","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.13228","snapshot_observed_at":"2026-08-10T14:39:22.654858Z","title":"arXiv preprint arXiv:2402.13228","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.15109","last_updated":"2025-01-25T07:21:50Z","snapshot_observed_at":"2026-08-10T21:52:15.934248Z","submitted_at":"2025-01-25T07:21:50Z","title":"Clear Preferences Leave Traces: Reference Model-Guided Sampling for Preference Learning","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-10T14:39:22.654858Z"},"links":{"cited_paper":"/paper/2402.13228","citing_paper":"/paper/2501.15109"},"observation_digest":"sha256:d0df3ae7517314bb265c2858a02b239c19ca1a36f083efbbfb0ba523dda23f38","observation_id":"d5707e30-3e9c-4230-8576-05f25e428de8","resolution":{"observed_at":"2026-08-10T14:39:22.654858Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.10148","last_updated":"2025-07-19T03:40:37Z","snapshot_observed_at":"2026-07-31T17:19:15.491176Z","submitted_at":"2024-10-14T04:29:57Z","title":"AlphaDPO: Adaptive Reward Margin for Direct Preference Optimization","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.10148","snapshot_observed_at":"2026-08-10T14:39:22.659889Z","title":"2024.α-DPO: Adaptive Reward Mar- gin is What Direct Preference Optimization Needs","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.15109","last_updated":"2025-01-25T07:21:50Z","snapshot_observed_at":"2026-08-10T21:52:15.934248Z","submitted_at":"2025-01-25T07:21:50Z","title":"Clear Preferences Leave Traces: Reference Model-Guided Sampling for Preference Learning","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-10T14:39:22.659889Z"},"links":{"cited_paper":"/paper/2410.10148","citing_paper":"/paper/2501.15109"},"observation_digest":"sha256:14d20b25b586272b7af33ba51e29935f6c06020d2baca01d6c247d0e34845155","observation_id":"a60a2d6f-201c-476f-8f32-95acc3e726bd","resolution":{"observed_at":"2026-08-10T14:39:22.659889Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.01377","last_updated":"2024-07-16T03:24:39Z","snapshot_observed_at":"2026-08-02T07:46:40.319683Z","submitted_at":"2023-10-02T17:40:01Z","title":"UltraFeedback: Boosting Language Models with Scaled AI Feedback","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.01377","snapshot_observed_at":"2026-08-10T14:39:22.565369Z","title":"arXiv preprint arXiv:2310.01377","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.15109","last_updated":"2025-01-25T07:21:50Z","snapshot_observed_at":"2026-08-10T21:52:15.934248Z","submitted_at":"2025-01-25T07:21:50Z","title":"Clear Preferences Leave Traces: Reference Model-Guided Sampling for Preference Learning","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-10T14:39:22.565369Z"},"links":{"cited_paper":"/paper/2310.01377","citing_paper":"/paper/2501.15109"},"observation_digest":"sha256:a30f892ce4656200b73b2642ac1ce12c405364f8293d665398e61239b838211d","observation_id":"d0c11f7f-e6a5-45f9-af30-f6f10cd69af9","resolution":{"observed_at":"2026-08-10T14:39:22.565369Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.00409","last_updated":"2024-04-12T01:09:37Z","snapshot_observed_at":"2026-08-10T03:27:36.910323Z","submitted_at":"2024-03-01T09:55:18Z","title":"Provably Robust DPO: Aligning Language Models with Noisy Feedback","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.00409","snapshot_observed_at":"2026-08-10T14:39:22.559926Z","title":"arXiv preprint arXiv:2403.00409","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.15109","last_updated":"2025-01-25T07:21:50Z","snapshot_observed_at":"2026-08-10T21:52:15.934248Z","submitted_at":"2025-01-25T07:21:50Z","title":"Clear Preferences Leave Traces: Reference Model-Guided Sampling for Preference Learning","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-10T14:39:22.559926Z"},"links":{"cited_paper":"/paper/2403.00409","citing_paper":"/paper/2501.15109"},"observation_digest":"sha256:f340dac645b4ac04135fd03719b9c35c30d457664a087af7a891f4871dac8165","observation_id":"86a11f2f-4317-4f7d-8b69-1c7f9e50bc3c","resolution":{"observed_at":"2026-08-10T14:39:22.559926Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2501.15109","last_updated":"2025-01-25T07:21:50Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-10T21:52:15.934248Z","submitted_at":"2025-01-25T07:21:50Z","title":"Clear Preferences Leave Traces: Reference Model-Guided Sampling for Preference Learning"},"reference_resolution":{"displayed":21,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":19,"verified_exact":0,"verified_fuzzy":1},"total_outbound_references":21},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"thesis":"As of 11 August 2026, this Paper Citation Record lists 21 of 21 outbound references and 0 inbound Pith citation observations for arXiv:2501.15109."}