{"as_of":"2026-08-19T06:02:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:16ecb96ea0229dd6826a0a930ac7a96f558b6aab720e1461ebc052830368ddff","coverage":[{"denominator":64,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":64,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T15:49:58.258118Z","state":"measured"},{"denominator":65,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":65,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-18T06:34:40.430872+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-27T00:48:56.892634Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-03T21:18:58.373323Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2509.25148","last_updated":"2026-06-18T03:33:32Z","snapshot_observed_at":"2026-08-16T22:17:46.796368Z","submitted_at":"2025-09-29T17:53:09Z","title":"AAPA: Adversarially Anchored Preference Alignment for Post-Training of Large Language Models","version":2},"cited_work":{"arxiv_id":"2509.25148","doi":null,"metadata_source":"pith","pith_arxiv_id":"2509.25148","snapshot_observed_at":"2026-07-03T21:18:58.373323Z","title":"AAPA: Adversarially Anchored Preference Alignment for Post-Training of Large Language Models","venue":"cs.AI","work_id":"6c0eead3-3aa2-4b5d-ad89-12c8f3faace0","year":2025},"citing_paper":{"arxiv_id":"2606.17735","last_updated":"2026-06-16T09:55:45Z","snapshot_observed_at":"2026-08-06T04:38:28.462018Z","submitted_at":"2026-06-16T09:55:45Z","title":"Shattering the Autoregressive Curse: Dynamic Epistemic Entropy Orchestrated Erasable Reinforcement Learning for LLMs","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-06-27T00:48:56.892634Z"},"links":{"cited_paper":"/paper/2509.25148","citing_paper":"/paper/2606.17735"},"observation_digest":"sha256:e366b36ca7ec436a1cb23d54cabb43cf8ea0919838d4a88b0fc31017c7e4278b","observation_id":"82e3a9ec-f72b-42da-b747-44ef9f62ab08","resolution":{"observed_at":"2026-07-03T21:18:58.374761Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2509.25148/citation-record","integrity":"/paper/2509.25148/integrity","json":"/paper/2509.25148/citation-record.json","paper":"/paper/2509.25148"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:49:58.790023Z","title":"Harnessing the power of llms in practice: A survey on chatgpt and beyond","venue":null,"work_id":"9323f8db-073a-4070-8b4d-88bf627ffb51","year":2024},"citing_paper":{"arxiv_id":"2509.25148","last_updated":"2026-06-18T03:33:32Z","snapshot_observed_at":"2026-08-16T22:17:46.796368Z","submitted_at":"2025-09-29T17:53:09Z","title":"AAPA: Adversarially Anchored Preference Alignment for Post-Training of Large Language Models","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-15T15:49:58.061817Z"},"links":{"citing_paper":"/paper/2509.25148"},"observation_digest":"sha256:f87c47b12a3e3749de14bb828b3dab7c9934791cd89446b8353676946afcb975","observation_id":"f85890b8-4fab-4908-b811-2d4220c38e01","resolution":{"observed_at":"2026-08-15T15:49:58.792700Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.12712","last_updated":"2023-04-13T20:41:31Z","snapshot_observed_at":"2026-08-18T22:17:47.865607Z","submitted_at":"2023-03-22T16:51:28Z","title":"Sparks of Artificial General Intelligence: Early experiments with GPT-4","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.12712","snapshot_observed_at":"2026-08-15T15:49:58.065373Z","title":"Sparks of artificial general intelligence: early experiments with gpt-4 (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.25148","last_updated":"2026-06-18T03:33:32Z","snapshot_observed_at":"2026-08-16T22:17:46.796368Z","submitted_at":"2025-09-29T17:53:09Z","title":"AAPA: Adversarially Anchored Preference Alignment for Post-Training of Large Language Models","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-15T15:49:58.065373Z"},"links":{"cited_paper":"/paper/2303.12712","citing_paper":"/paper/2509.25148"},"observation_digest":"sha256:177d53d5418ead39d9d54eff67c0c15d37a503fd96ad24b1f2cc56354c12d509","observation_id":"7e4e84ab-65ee-43a4-9e33-dee86a050071","resolution":{"observed_at":"2026-08-15T15:49:58.065373Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.06786","last_updated":"2025-09-08T15:13:23Z","snapshot_observed_at":"2026-08-16T22:16:58.655548Z","submitted_at":"2025-09-08T15:13:23Z","title":"\\texttt{R$^\\textbf{2}$AI}: Towards Resistant and Resilient AI in an Evolving World","version":1},"cited_work":{"arxiv_id":"2509.06786","doi":null,"metadata_source":"pith","pith_arxiv_id":"2509.06786","snapshot_observed_at":"2026-08-15T15:49:58.602175Z","title":"\\texttt{R$^\\textbf{2}$AI}: Towards Resistant and Resilient AI in an Evolving World","venue":"cs.LG","work_id":"1e656889-54bf-47b3-bdea-f195965e561d","year":2025},"citing_paper":{"arxiv_id":"2509.25148","last_updated":"2026-06-18T03:33:32Z","snapshot_observed_at":"2026-08-16T22:17:46.796368Z","submitted_at":"2025-09-29T17:53:09Z","title":"AAPA: Adversarially Anchored Preference Alignment for Post-Training of Large Language Models","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-15T15:49:58.068948Z"},"links":{"cited_paper":"/paper/2509.06786","citing_paper":"/paper/2509.25148"},"observation_digest":"sha256:6839e852f84dcc3832e3eb2b4dc685f8c61da0589ab60a0bafea4ad4b28a94a1","observation_id":"d9048366-9d1e-4557-b7db-57d92e51a4dc","resolution":{"observed_at":"2026-08-15T15:49:58.605246Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:49:58.781951Z","title":"A survey on post-training of large language models.arXiv e-prints, pages arXiv–2503, 2025","venue":null,"work_id":"e67bb970-17a8-4d09-8745-2dde226998bf","year":2025},"citing_paper":{"arxiv_id":"2509.25148","last_updated":"2026-06-18T03:33:32Z","snapshot_observed_at":"2026-08-16T22:17:46.796368Z","submitted_at":"2025-09-29T17:53:09Z","title":"AAPA: Adversarially Anchored Preference Alignment for Post-Training of Large Language Models","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-15T15:49:58.072181Z"},"links":{"citing_paper":"/paper/2509.25148"},"observation_digest":"sha256:d25fd168a9ff87b06b1e1a5a5ca764e8d7bb38abeb6944a73cc15378f629a181","observation_id":"3e67ee99-bf16-4aeb-b499-937ff5aa3806","resolution":{"observed_at":"2026-08-15T15:49:58.785712Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:49:58.075991Z","title":"Training language models to follow instructions with human feedback","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.25148","last_updated":"2026-06-18T03:33:32Z","snapshot_observed_at":"2026-08-16T22:17:46.796368Z","submitted_at":"2025-09-29T17:53:09Z","title":"AAPA: Adversarially Anchored Preference Alignment for Post-Training of Large Language Models","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-15T15:49:58.075991Z"},"links":{"citing_paper":"/paper/2509.25148"},"observation_digest":"sha256:53ed08e48ec0509d92f6d2d3434cc15a4ccf84370fe3bd12453ffb1e7c0aa9b4","observation_id":"4fdda5c9-fb6f-4973-82ea-31fa4c32784f","resolution":{"observed_at":"2026-08-15T15:49:58.075991Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:49:58.078529Z","title":"Deep reinforcement learning from human preferences","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2509.25148","last_updated":"2026-06-18T03:33:32Z","snapshot_observed_at":"2026-08-16T22:17:46.796368Z","submitted_at":"2025-09-29T17:53:09Z","title":"AAPA: Adversarially Anchored Preference Alignment for Post-Training of Large Language Models","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-15T15:49:58.078529Z"},"links":{"citing_paper":"/paper/2509.25148"},"observation_digest":"sha256:7804bfa843ca2ecbc42a066a4ab842259c01e8234487489827c6f3d7a30b165e","observation_id":"4f8a0d64-a97c-4051-83e3-f8f4f95bf819","resolution":{"observed_at":"2026-08-15T15:49:58.078529Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:49:58.081745Z","title":"Direct preference optimization: Your language model is secretly a reward model","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.25148","last_updated":"2026-06-18T03:33:32Z","snapshot_observed_at":"2026-08-16T22:17:46.796368Z","submitted_at":"2025-09-29T17:53:09Z","title":"AAPA: Adversarially Anchored Preference Alignment for Post-Training of Large Language Models","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-15T15:49:58.081745Z"},"links":{"citing_paper":"/paper/2509.25148"},"observation_digest":"sha256:1600543171b5f972d96fc4d691133679aabd06ca7b58fbcac9d2d21136216343","observation_id":"d98b61c7-d0b4-4444-8999-b0f0948a7d50","resolution":{"observed_at":"2026-08-15T15:49:58.081745Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-15T15:49:58.084732Z","title":"Deepseekmath: Pushing the limits of mathematical reasoning in open language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.25148","last_updated":"2026-06-18T03:33:32Z","snapshot_observed_at":"2026-08-16T22:17:46.796368Z","submitted_at":"2025-09-29T17:53:09Z","title":"AAPA: Adversarially Anchored Preference Alignment for Post-Training of Large Language Models","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-15T15:49:58.084732Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2509.25148"},"observation_digest":"sha256:056b220f4a1b2db412bb1f764b69ab9c2b942012adc8aa6481e6045011776462","observation_id":"c8aec489-bfc7-4e0d-9795-013e3887e282","resolution":{"observed_at":"2026-08-15T15:49:58.084732Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:49:58.765490Z","title":"Curriculum offline imitating learning","venue":null,"work_id":"8d2021e2-35c7-4076-9de0-da03b7c735f4","year":2021},"citing_paper":{"arxiv_id":"2509.25148","last_updated":"2026-06-18T03:33:32Z","snapshot_observed_at":"2026-08-16T22:17:46.796368Z","submitted_at":"2025-09-29T17:53:09Z","title":"AAPA: Adversarially Anchored Preference Alignment for Post-Training of Large Language Models","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-15T15:49:58.088393Z"},"links":{"citing_paper":"/paper/2509.25148"},"observation_digest":"sha256:7cac6502d26a81984ef291b319329c5949c70e498f24592dfefa38c40fa6c0f8","observation_id":"56686d20-3a5d-490d-bb73-6df25066f822","resolution":{"observed_at":"2026-08-15T15:49:58.768174Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:49:58.758867Z","title":"Offline imitation learning with suboptimal demonstrations via relaxed distribution matching","venue":null,"work_id":"63916dbe-56cc-457b-989f-7268571f56ce","year":2023},"citing_paper":{"arxiv_id":"2509.25148","last_updated":"2026-06-18T03:33:32Z","snapshot_observed_at":"2026-08-16T22:17:46.796368Z","submitted_at":"2025-09-29T17:53:09Z","title":"AAPA: Adversarially Anchored Preference Alignment for Post-Training of Large Language Models","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-15T15:49:58.091500Z"},"links":{"citing_paper":"/paper/2509.25148"},"observation_digest":"sha256:85f3b48355fed9b9274131cddde37450b8e7a047cdb19855a6ceb4819db1cb38","observation_id":"11144b59-b2cf-4452-a379-532cd0493a36","resolution":{"observed_at":"2026-08-15T15:49:58.761477Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16145","last_updated":"2024-12-25T18:54:02Z","snapshot_observed_at":"2026-08-18T16:03:34.886701Z","submitted_at":"2024-12-20T18:49:45Z","title":"Offline Reinforcement Learning for LLM Multi-Step Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.16145","snapshot_observed_at":"2026-08-15T15:49:58.094264Z","title":"Offline reinforcement learning for llm multi-step reasoning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.25148","last_updated":"2026-06-18T03:33:32Z","snapshot_observed_at":"2026-08-16T22:17:46.796368Z","submitted_at":"2025-09-29T17:53:09Z","title":"AAPA: Adversarially Anchored Preference Alignment for Post-Training of Large Language Models","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-15T15:49:58.094264Z"},"links":{"cited_paper":"/paper/2412.16145","citing_paper":"/paper/2509.25148"},"observation_digest":"sha256:292d70b0f94b81883b5de360cff45af28d97960b16aa2a275e3493e494305f1c","observation_id":"e38fa1cb-b58c-4008-acaa-fc7a3123f3b3","resolution":{"observed_at":"2026-08-15T15:49:58.094264Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:49:58.097622Z","title":"Grounding large language models in interactive environments with online reinforcement learning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.25148","last_updated":"2026-06-18T03:33:32Z","snapshot_observed_at":"2026-08-16T22:17:46.796368Z","submitted_at":"2025-09-29T17:53:09Z","title":"AAPA: Adversarially Anchored Preference Alignment for Post-Training of Large Language Models","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-15T15:49:58.097622Z"},"links":{"citing_paper":"/paper/2509.25148"},"observation_digest":"sha256:ab02b5dc3aff6bf5eee17b719846dbe85bb9b2ed8ad3d3af442dc890de9e3f73","observation_id":"1cd45998-58e6-4d1a-b03b-681575012957","resolution":{"observed_at":"2026-08-15T15:49:58.097622Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:49:58.748317Z","title":"Provably mitigating overoptimization in rlhf: Your sft loss is implicitly an adversarial regularizer","venue":null,"work_id":"1e965436-7938-4608-aaa0-304f61b98609","year":2024},"citing_paper":{"arxiv_id":"2509.25148","last_updated":"2026-06-18T03:33:32Z","snapshot_observed_at":"2026-08-16T22:17:46.796368Z","submitted_at":"2025-09-29T17:53:09Z","title":"AAPA: Adversarially Anchored Preference Alignment for Post-Training of Large Language Models","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-15T15:49:58.100869Z"},"links":{"citing_paper":"/paper/2509.25148"},"observation_digest":"sha256:2e817c7c9b6e3e3433ed26dd37211b668d8dc1ab60f39bb5cb2ab040405799cb","observation_id":"a34bb80f-a6e5-47ef-b26c-5de71dbef4dc","resolution":{"observed_at":"2026-08-15T15:49:58.751138Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.16673","last_updated":"2025-04-05T08:56:18Z","snapshot_observed_at":"2026-08-16T13:22:52.224350Z","submitted_at":"2024-08-29T16:21:00Z","title":"Preserving Diversity in Supervised Fine-Tuning of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.16673","snapshot_observed_at":"2026-08-15T15:49:58.103306Z","title":"Entropic distribution matching in supervised fine-tuning of llms: Less overfitting and better diversity.(2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.25148","last_updated":"2026-06-18T03:33:32Z","snapshot_observed_at":"2026-08-16T22:17:46.796368Z","submitted_at":"2025-09-29T17:53:09Z","title":"AAPA: Adversarially Anchored Preference Alignment for Post-Training of Large Language Models","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-15T15:49:58.103306Z"},"links":{"cited_paper":"/paper/2408.16673","citing_paper":"/paper/2509.25148"},"observation_digest":"sha256:cc6ba3aa90bc202fee2e8a0c31448d7798b8e977c141e485e94fd70798cded77","observation_id":"12dcd533-12d3-4efd-8ae2-85c5e8b1fe88","resolution":{"observed_at":"2026-08-15T15:49:58.103306Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1701.06548","last_updated":"2017-01-23T18:35:28Z","snapshot_observed_at":"2026-08-14T21:19:55.038511Z","submitted_at":"2017-01-23T18:35:28Z","title":"Regularizing Neural Networks by Penalizing Confident Output Distributions","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1701.06548","snapshot_observed_at":"2026-08-15T15:49:58.106522Z","title":"Regularizing neural networks by penalizing confident output distributions","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2509.25148","last_updated":"2026-06-18T03:33:32Z","snapshot_observed_at":"2026-08-16T22:17:46.796368Z","submitted_at":"2025-09-29T17:53:09Z","title":"AAPA: Adversarially Anchored Preference Alignment for Post-Training of Large Language Models","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-15T15:49:58.106522Z"},"links":{"cited_paper":"/paper/1701.06548","citing_paper":"/paper/2509.25148"},"observation_digest":"sha256:0820ef323cd0101b0d58c2c35b753dcfb2ea3a759a529bd054aca89a36329633","observation_id":"070ec0c1-259d-4d4b-8a41-30d2908456ab","resolution":{"observed_at":"2026-08-15T15:49:58.106522Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:49:58.740342Z","title":"Stanford alpaca: An instruction-following llama model, 2023","venue":null,"work_id":"789d59b6-89af-4f29-8fa1-c35b33f4d345","year":2023},"citing_paper":{"arxiv_id":"2509.25148","last_updated":"2026-06-18T03:33:32Z","snapshot_observed_at":"2026-08-16T22:17:46.796368Z","submitted_at":"2025-09-29T17:53:09Z","title":"AAPA: Adversarially Anchored Preference Alignment for Post-Training of Large Language Models","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-15T15:49:58.109290Z"},"links":{"citing_paper":"/paper/2509.25148"},"observation_digest":"sha256:8dfb6531cb3625dbb588a5e46d38201bb4134ffd3dbc28a3af5708bf704c3b60","observation_id":"b801e931-70b3-47d3-9822-e7b9710433c2","resolution":{"observed_at":"2026-08-15T15:49:58.743340Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.01377","last_updated":"2024-07-16T03:24:39Z","snapshot_observed_at":"2026-08-14T00:28:11.851309Z","submitted_at":"2023-10-02T17:40:01Z","title":"UltraFeedback: Boosting Language Models with Scaled AI Feedback","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.01377","snapshot_observed_at":"2026-08-15T15:49:58.111627Z","title":"Ultrafeedback: Boosting language models with scaled ai feedback","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.25148","last_updated":"2026-06-18T03:33:32Z","snapshot_observed_at":"2026-08-16T22:17:46.796368Z","submitted_at":"2025-09-29T17:53:09Z","title":"AAPA: Adversarially Anchored Preference Alignment for Post-Training of Large Language Models","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-15T15:49:58.111627Z"},"links":{"cited_paper":"/paper/2310.01377","citing_paper":"/paper/2509.25148"},"observation_digest":"sha256:0683b4ee822403e4f3d6cdd6350a4cb79b7d000b7a4f6e09ecbf1cc21341fdcc","observation_id":"2b49f18d-da45-43a6-b2be-234497283dd4","resolution":{"observed_at":"2026-08-15T15:49:58.111627Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:49:58.733571Z","title":"On the diversity of synthetic data and its impact on training large language models,","venue":null,"work_id":"7a723305-dbbf-4b33-b2ed-ed8f9c5ba55b","year":null},"citing_paper":{"arxiv_id":"2509.25148","last_updated":"2026-06-18T03:33:32Z","snapshot_observed_at":"2026-08-16T22:17:46.796368Z","submitted_at":"2025-09-29T17:53:09Z","title":"AAPA: Adversarially Anchored Preference Alignment for Post-Training of Large Language Models","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-15T15:49:58.114383Z"},"links":{"citing_paper":"/paper/2509.25148"},"observation_digest":"sha256:a9224cb014787bfcb7ed5154d3a3b9375fb1fb5cc58210a629a808d2d7abcde3","observation_id":"2316bf61-624d-421a-83bc-f0cf68cc97f7","resolution":{"observed_at":"2026-08-15T15:49:58.736182Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:49:58.725576Z","title":"Condor: Enhance llm alignment with knowledge-driven data synthesis and refinement","venue":null,"work_id":"ba43f6c4-585b-4357-bf97-9f83699ace51","year":2025},"citing_paper":{"arxiv_id":"2509.25148","last_updated":"2026-06-18T03:33:32Z","snapshot_observed_at":"2026-08-16T22:17:46.796368Z","submitted_at":"2025-09-29T17:53:09Z","title":"AAPA: Adversarially Anchored Preference Alignment for Post-Training of Large Language Models","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-15T15:49:58.119357Z"},"links":{"citing_paper":"/paper/2509.25148"},"observation_digest":"sha256:c53edd2213e0be6e5a04ef5816dc54c70a5025db9fda86ea2a420a5e96e94743","observation_id":"b8b1e8c8-d5b7-413e-9e0c-7d90f7b60170","resolution":{"observed_at":"2026-08-15T15:49:58.728110Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:49:58.718583Z","title":"Idgen: Item discrimination induced prompt generation for llm evaluation","venue":null,"work_id":"2fde3ca4-178a-41e8-b719-c013adf3d72b","year":2024},"citing_paper":{"arxiv_id":"2509.25148","last_updated":"2026-06-18T03:33:32Z","snapshot_observed_at":"2026-08-16T22:17:46.796368Z","submitted_at":"2025-09-29T17:53:09Z","title":"AAPA: Adversarially Anchored Preference Alignment for Post-Training of Large Language Models","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-15T15:49:58.123053Z"},"links":{"citing_paper":"/paper/2509.25148"},"observation_digest":"sha256:d9640f7156e58d6ef46ced004fac1963b2ba48d3140edc956b023d65f3aa9bf3","observation_id":"938e0ef4-961e-4a9c-9218-bd996afa1a9b","resolution":{"observed_at":"2026-08-15T15:49:58.721234Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-08-15T15:49:58.126327Z","title":"Qwen3 technical report","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.25148","last_updated":"2026-06-18T03:33:32Z","snapshot_observed_at":"2026-08-16T22:17:46.796368Z","submitted_at":"2025-09-29T17:53:09Z","title":"AAPA: Adversarially Anchored Preference Alignment for Post-Training of Large Language Models","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-15T15:49:58.126327Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2509.25148"},"observation_digest":"sha256:57f4423eab9f90f66facd9a6512850e779bf995d33bf0f8050a39496d5293b8b","observation_id":"d27af825-ab83-4627-be9a-6228d708508d","resolution":{"observed_at":"2026-08-15T15:49:58.126327Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.19437","last_updated":"2025-02-18T17:26:38Z","snapshot_observed_at":"2026-08-18T18:18:37.449517Z","submitted_at":"2024-12-27T04:03:16Z","title":"DeepSeek-V3 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.19437","snapshot_observed_at":"2026-08-15T15:49:58.129064Z","title":"Deepseek-v3 technical report","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.25148","last_updated":"2026-06-18T03:33:32Z","snapshot_observed_at":"2026-08-16T22:17:46.796368Z","submitted_at":"2025-09-29T17:53:09Z","title":"AAPA: Adversarially Anchored Preference Alignment for Post-Training of Large Language Models","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-15T15:49:58.129064Z"},"links":{"cited_paper":"/paper/2412.19437","citing_paper":"/paper/2509.25148"},"observation_digest":"sha256:d5095765a51a4e6b4626379c12a4e67cb502a348486864e392c9e6d2a94b5e24","observation_id":"08e3b7df-4394-48c2-85f5-199226c1483e","resolution":{"observed_at":"2026-08-15T15:49:58.129064Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.08295","last_updated":"2024-04-16T12:52:47Z","snapshot_observed_at":"2026-08-03T03:29:01.959523Z","submitted_at":"2024-03-13T06:59:16Z","title":"Gemma: Open Models Based on Gemini Research and Technology","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.08295","snapshot_observed_at":"2026-08-15T15:49:58.132125Z","title":"Gemma: Open models based on gemini research and technology","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.25148","last_updated":"2026-06-18T03:33:32Z","snapshot_observed_at":"2026-08-16T22:17:46.796368Z","submitted_at":"2025-09-29T17:53:09Z","title":"AAPA: Adversarially Anchored Preference Alignment for Post-Training of Large Language Models","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-15T15:49:58.132125Z"},"links":{"cited_paper":"/paper/2403.08295","citing_paper":"/paper/2509.25148"},"observation_digest":"sha256:f2d4c93d2c3b4cdd01492dc452272e66f8e32b60a61c64b577ce26537073f642","observation_id":"4fcddce0-5c59-4725-bca2-b15566824e6e","resolution":{"observed_at":"2026-08-15T15:49:58.132125Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-17T09:58:46.058102Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-15T15:49:58.136271Z","title":"Gpt-4 technical report","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.25148","last_updated":"2026-06-18T03:33:32Z","snapshot_observed_at":"2026-08-16T22:17:46.796368Z","submitted_at":"2025-09-29T17:53:09Z","title":"AAPA: Adversarially Anchored Preference Alignment for Post-Training of Large Language Models","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-15T15:49:58.136271Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2509.25148"},"observation_digest":"sha256:bd5b0148b464064bae96cce8ae046b237189d1775a34b3d82c12ac28f1f1d037","observation_id":"98c886ce-718d-4454-8c6e-ccafe91ea064","resolution":{"observed_at":"2026-08-15T15:49:58.136271Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.08045","last_updated":"2024-06-03T11:34:05Z","snapshot_observed_at":"2026-08-16T14:43:29.644593Z","submitted_at":"2023-11-14T10:10:31Z","title":"Adversarial Preference Optimization: Enhancing Your Alignment via RM-LLM Game","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.08045","snapshot_observed_at":"2026-08-15T15:49:58.138798Z","title":"Adversarial preference optimization: Enhancing your alignment via rm-llm game","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.25148","last_updated":"2026-06-18T03:33:32Z","snapshot_observed_at":"2026-08-16T22:17:46.796368Z","submitted_at":"2025-09-29T17:53:09Z","title":"AAPA: Adversarially Anchored Preference Alignment for Post-Training of Large Language Models","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-15T15:49:58.138798Z"},"links":{"cited_paper":"/paper/2311.08045","citing_paper":"/paper/2509.25148"},"observation_digest":"sha256:578db389ebf0ce8a3064a1a787df0b6df835661e73413ec2ab8a4ce91e243f95","observation_id":"23866afd-1047-4d4b-b9ec-a3a32e138b27","resolution":{"observed_at":"2026-08-15T15:49:58.138798Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.15124","last_updated":"2025-04-14T22:39:09Z","snapshot_observed_at":"2026-08-17T14:11:00.232598Z","submitted_at":"2024-11-22T18:44:04Z","title":"Tulu 3: Pushing Frontiers in Open Language Model Post-Training","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.15124","snapshot_observed_at":"2026-08-15T15:49:58.142255Z","title":"Tulu 3: Pushing frontiers in open language model post-training","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.25148","last_updated":"2026-06-18T03:33:32Z","snapshot_observed_at":"2026-08-16T22:17:46.796368Z","submitted_at":"2025-09-29T17:53:09Z","title":"AAPA: Adversarially Anchored Preference Alignment for Post-Training of Large Language Models","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-15T15:49:58.142255Z"},"links":{"cited_paper":"/paper/2411.15124","citing_paper":"/paper/2509.25148"},"observation_digest":"sha256:51f65f7cfd6dc9db7169ac497e6c5d9ce97e7aca519dfb6a43c1b39d41a5b3ff","observation_id":"d439eeeb-0b36-4daa-8288-a0f1779a44bd","resolution":{"observed_at":"2026-08-15T15:49:58.142255Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-08-15T12:33:55.451951Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-15T15:49:58.146538Z","title":"Deepseek-r1: Incentivizing reasoning capability in llms via reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.25148","last_updated":"2026-06-18T03:33:32Z","snapshot_observed_at":"2026-08-16T22:17:46.796368Z","submitted_at":"2025-09-29T17:53:09Z","title":"AAPA: Adversarially Anchored Preference Alignment for Post-Training of Large Language Models","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-15T15:49:58.146538Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2509.25148"},"observation_digest":"sha256:0921003871578ca5ffb8acf6b1226175cf3aa1f3a199da4e6f822f41c5c0f216","observation_id":"df333a4f-9aea-4408-801c-1d20fc8e213d","resolution":{"observed_at":"2026-08-15T15:49:58.146538Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:49:58.150276Z","title":"Reinforcement learning with verifiable rewards: Grpo’s effective loss, dynam- ics, and success amplification","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.25148","last_updated":"2026-06-18T03:33:32Z","snapshot_observed_at":"2026-08-16T22:17:46.796368Z","submitted_at":"2025-09-29T17:53:09Z","title":"AAPA: Adversarially Anchored Preference Alignment for Post-Training of Large Language Models","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-15T15:49:58.150276Z"},"links":{"citing_paper":"/paper/2509.25148"},"observation_digest":"sha256:64f4762768a910ccfe0974a718d2af340ac289bdee422a8b014569a305043d96","observation_id":"7c7ec438-faeb-4e0b-ba3b-1a95d3c8c691","resolution":{"observed_at":"2026-08-15T15:49:58.150276Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.00820","last_updated":"2024-10-28T17:05:10Z","snapshot_observed_at":"2026-08-18T00:54:55.289567Z","submitted_at":"2024-10-28T17:05:10Z","title":"AutoGLM: Autonomous Foundation Agents for GUIs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.00820","snapshot_observed_at":"2026-08-15T15:49:58.152922Z","title":"Autoglm: Autonomous foundation agents for guis","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.25148","last_updated":"2026-06-18T03:33:32Z","snapshot_observed_at":"2026-08-16T22:17:46.796368Z","submitted_at":"2025-09-29T17:53:09Z","title":"AAPA: Adversarially Anchored Preference Alignment for Post-Training of Large Language Models","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-15T15:49:58.152922Z"},"links":{"cited_paper":"/paper/2411.00820","citing_paper":"/paper/2509.25148"},"observation_digest":"sha256:3df6e1cad636bb694a783e76752a6fd55c95c556cbae1d40b99faeaa416e5ce6","observation_id":"028c0ad8-5942-4d92-9c1f-aaa47d435aab","resolution":{"observed_at":"2026-08-15T15:49:58.152922Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14476","last_updated":"2025-05-20T01:37:34Z","snapshot_observed_at":"2026-08-18T05:01:20.543826Z","submitted_at":"2025-03-18T17:49:06Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.14476","snapshot_observed_at":"2026-08-15T15:49:58.155753Z","title":"Dapo: An open-source llm reinforcement learning system at scale, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.25148","last_updated":"2026-06-18T03:33:32Z","snapshot_observed_at":"2026-08-16T22:17:46.796368Z","submitted_at":"2025-09-29T17:53:09Z","title":"AAPA: Adversarially Anchored Preference Alignment for Post-Training of Large Language Models","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-15T15:49:58.155753Z"},"links":{"cited_paper":"/paper/2503.14476","citing_paper":"/paper/2509.25148"},"observation_digest":"sha256:66c5009025f7239d432acd95b338f400cfbe32e975e648cbeef206087c55e436","observation_id":"7ebdcc37-7fe3-49c2-b0a6-2d60a82ad4c6","resolution":{"observed_at":"2026-08-15T15:49:58.155753Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.17161","last_updated":"2025-05-26T17:16:45Z","snapshot_observed_at":"2026-08-09T18:26:12.869738Z","submitted_at":"2025-01-28T18:59:44Z","title":"SFT Memorizes, RL Generalizes: A Comparative Study of Foundation Model Post-training","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.17161","snapshot_observed_at":"2026-08-15T15:49:58.158558Z","title":"Sft memorizes, rl generalizes: A comparative study of foundation model post-training","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.25148","last_updated":"2026-06-18T03:33:32Z","snapshot_observed_at":"2026-08-16T22:17:46.796368Z","submitted_at":"2025-09-29T17:53:09Z","title":"AAPA: Adversarially Anchored Preference Alignment for Post-Training of Large Language Models","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-15T15:49:58.158558Z"},"links":{"cited_paper":"/paper/2501.17161","citing_paper":"/paper/2509.25148"},"observation_digest":"sha256:7b335d68792802b6a3294a2df7fa593c0f9f1c66aeb562b812dcd37f44b55d12","observation_id":"a7faba00-97d3-403c-a438-df0d71050587","resolution":{"observed_at":"2026-08-15T15:49:58.158558Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.05193","last_updated":"2024-11-27T00:05:44Z","snapshot_observed_at":"2026-08-16T13:01:55.976106Z","submitted_at":"2024-11-07T21:36:52Z","title":"Q-SFT: Q-Learning for Language Models via Supervised Fine-Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.05193","snapshot_observed_at":"2026-08-15T15:49:58.162168Z","title":"Q-sft: Q-learning for language models via supervised fine-tuning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.25148","last_updated":"2026-06-18T03:33:32Z","snapshot_observed_at":"2026-08-16T22:17:46.796368Z","submitted_at":"2025-09-29T17:53:09Z","title":"AAPA: Adversarially Anchored Preference Alignment for Post-Training of Large Language Models","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-15T15:49:58.162168Z"},"links":{"cited_paper":"/paper/2411.05193","citing_paper":"/paper/2509.25148"},"observation_digest":"sha256:2a2af59f6b15f7662a13c52e494e763cf2c8c2401aff51bad38fa36e823b7df1","observation_id":"04c91798-d270-49d5-8e48-98e58360054b","resolution":{"observed_at":"2026-08-15T15:49:58.162168Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:49:58.165261Z","title":"On-policy rl meets off-policy experts: Harmonizing supervised fine- tuning and reinforcement learning via dynamic weighting","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.25148","last_updated":"2026-06-18T03:33:32Z","snapshot_observed_at":"2026-08-16T22:17:46.796368Z","submitted_at":"2025-09-29T17:53:09Z","title":"AAPA: Adversarially Anchored Preference Alignment for Post-Training of Large Language Models","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-15T15:49:58.165261Z"},"links":{"citing_paper":"/paper/2509.25148"},"observation_digest":"sha256:01d5a9552317d2f6a46255f81b56c97036f2391b89e6b83bbb177b5415afc54c","observation_id":"98ef0e3a-b85d-4bb8-9e5d-8a6ec1c0af87","resolution":{"observed_at":"2026-08-15T15:49:58.165261Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.14945","last_updated":"2025-06-22T00:18:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-21T08:09:13Z","title":"Learning to Reason under Off-Policy Guidance","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.14945","snapshot_observed_at":"2026-08-15T15:49:58.169948Z","title":"Learning to reason under off-policy guidance","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.25148","last_updated":"2026-06-18T03:33:32Z","snapshot_observed_at":"2026-08-16T22:17:46.796368Z","submitted_at":"2025-09-29T17:53:09Z","title":"AAPA: Adversarially Anchored Preference Alignment for Post-Training of Large Language Models","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-15T15:49:58.169948Z"},"links":{"cited_paper":"/paper/2504.14945","citing_paper":"/paper/2509.25148"},"observation_digest":"sha256:e4c3dce5e9c997b946cfb0bf26c136f5d34f0cbdca0873bde56f40c539ff26ce","observation_id":"b3ecce42-6552-4fbe-b36c-1906c1d830e9","resolution":{"observed_at":"2026-08-15T15:49:58.169948Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.17211","last_updated":"2025-06-20T17:59:07Z","snapshot_observed_at":"2026-08-18T12:21:48.819822Z","submitted_at":"2025-06-20T17:59:07Z","title":"BREAD: Branched Rollouts from Expert Anchors Bridge SFT & RL for Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.17211","snapshot_observed_at":"2026-08-15T15:49:58.173572Z","title":"Bread: Branched rollouts from expert anchors bridge sft & rl for reasoning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.25148","last_updated":"2026-06-18T03:33:32Z","snapshot_observed_at":"2026-08-16T22:17:46.796368Z","submitted_at":"2025-09-29T17:53:09Z","title":"AAPA: Adversarially Anchored Preference Alignment for Post-Training of Large Language Models","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-15T15:49:58.173572Z"},"links":{"cited_paper":"/paper/2506.17211","citing_paper":"/paper/2509.25148"},"observation_digest":"sha256:bd37392ee66ac113b33d99c891ad87c3dace64e12a817e66fdeb1068df3be052","observation_id":"8858a5b0-372f-42e1-a199-4c9d910cbcb6","resolution":{"observed_at":"2026-08-15T15:49:58.173572Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.19767","last_updated":"2025-06-24T16:31:37Z","snapshot_observed_at":"2026-08-17T17:58:03.429114Z","submitted_at":"2025-06-24T16:31:37Z","title":"SRFT: A Single-Stage Method with Supervised and Reinforcement Fine-Tuning for Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.19767","snapshot_observed_at":"2026-08-15T15:49:58.176602Z","title":"Srft: A single-stage method with supervised and reinforcement fine-tuning for reasoning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.25148","last_updated":"2026-06-18T03:33:32Z","snapshot_observed_at":"2026-08-16T22:17:46.796368Z","submitted_at":"2025-09-29T17:53:09Z","title":"AAPA: Adversarially Anchored Preference Alignment for Post-Training of Large Language Models","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-15T15:49:58.176602Z"},"links":{"cited_paper":"/paper/2506.19767","citing_paper":"/paper/2509.25148"},"observation_digest":"sha256:2754bc3286d0efe0fff8a5d9b15c7b953f6630ff9dc2cd026b2f969aa33e1dba","observation_id":"a5c519e1-9d20-4eb9-af14-6b057420aa87","resolution":{"observed_at":"2026-08-15T15:49:58.176602Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.13542","last_updated":"2024-07-18T09:00:23Z","snapshot_observed_at":"2026-08-16T13:41:27.031886Z","submitted_at":"2024-06-19T13:29:53Z","title":"Self-play with Execution Feedback: Improving Instruction-following Capabilities of Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.13542","snapshot_observed_at":"2026-08-15T15:49:58.179658Z","title":"Self-play with execution feedback: Improving instruction-following capabilities of large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.25148","last_updated":"2026-06-18T03:33:32Z","snapshot_observed_at":"2026-08-16T22:17:46.796368Z","submitted_at":"2025-09-29T17:53:09Z","title":"AAPA: Adversarially Anchored Preference Alignment for Post-Training of Large Language Models","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-15T15:49:58.179658Z"},"links":{"cited_paper":"/paper/2406.13542","citing_paper":"/paper/2509.25148"},"observation_digest":"sha256:e7e99e9e70151cc63879205418abb88e79dd2a6c0becb11ad8d2085bb33271a8","observation_id":"875a2f1d-728a-487a-90bc-606c0c1d27da","resolution":{"observed_at":"2026-08-15T15:49:58.179658Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:49:58.183190Z","title":"Magpie: Alignment data synthesis from scratch by prompting aligned llms with nothing, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.25148","last_updated":"2026-06-18T03:33:32Z","snapshot_observed_at":"2026-08-16T22:17:46.796368Z","submitted_at":"2025-09-29T17:53:09Z","title":"AAPA: Adversarially Anchored Preference Alignment for Post-Training of Large Language Models","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-15T15:49:58.183190Z"},"links":{"citing_paper":"/paper/2509.25148"},"observation_digest":"sha256:ed94fc2e5ee82b71ec1a6ef52244c19a709959959337ef73e2fbe35fe517ea32","observation_id":"a198c5bc-aa3d-440b-bb9a-8d46304380f5","resolution":{"observed_at":"2026-08-15T15:49:58.183190Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:49:58.185865Z","title":"Generalizing verifiable instruction following, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.25148","last_updated":"2026-06-18T03:33:32Z","snapshot_observed_at":"2026-08-16T22:17:46.796368Z","submitted_at":"2025-09-29T17:53:09Z","title":"AAPA: Adversarially Anchored Preference Alignment for Post-Training of Large Language Models","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-15T15:49:58.185865Z"},"links":{"citing_paper":"/paper/2509.25148"},"observation_digest":"sha256:fe4944ef5f2186d7416711b97b99670875d451cc6007eb148a40731de939cc4d","observation_id":"54df15d6-af5d-4049-993c-1bde54bbe74c","resolution":{"observed_at":"2026-08-15T15:49:58.185865Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07911","last_updated":"2023-11-14T05:13:55Z","snapshot_observed_at":"2026-07-06T16:47:08.877195Z","submitted_at":"2023-11-14T05:13:55Z","title":"Instruction-Following Evaluation for Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.07911","snapshot_observed_at":"2026-08-15T15:49:58.188396Z","title":"Instruction-following evaluation for large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.25148","last_updated":"2026-06-18T03:33:32Z","snapshot_observed_at":"2026-08-16T22:17:46.796368Z","submitted_at":"2025-09-29T17:53:09Z","title":"AAPA: Adversarially Anchored Preference Alignment for Post-Training of Large Language Models","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-15T15:49:58.188396Z"},"links":{"cited_paper":"/paper/2311.07911","citing_paper":"/paper/2509.25148"},"observation_digest":"sha256:f70a2f874147561f2ffd487ae71c251a9216eab95dd19b5da109ef56f3223405","observation_id":"a762c342-dd82-4265-8ff4-5eedfda017f5","resolution":{"observed_at":"2026-08-15T15:49:58.188396Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.15553","last_updated":"2024-11-13T04:26:13Z","snapshot_observed_at":"2026-08-16T18:18:26.938255Z","submitted_at":"2024-10-21T00:59:47Z","title":"Multi-IF: Benchmarking LLMs on Multi-Turn and Multilingual Instructions Following","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.15553","snapshot_observed_at":"2026-08-15T15:49:58.190607Z","title":"Multi-if: Benchmarking llms on multi-turn and multilingual instructions following","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.25148","last_updated":"2026-06-18T03:33:32Z","snapshot_observed_at":"2026-08-16T22:17:46.796368Z","submitted_at":"2025-09-29T17:53:09Z","title":"AAPA: Adversarially Anchored Preference Alignment for Post-Training of Large Language Models","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-15T15:49:58.190607Z"},"links":{"cited_paper":"/paper/2410.15553","citing_paper":"/paper/2509.25148"},"observation_digest":"sha256:c17172759007faac91b340a14c00088f5355f87212e8a2cb104d5f20467ece7c","observation_id":"92da0776-98c2-4f65-8985-74d5e47917c4","resolution":{"observed_at":"2026-08-15T15:49:58.190607Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2009.03300","last_updated":"2021-01-12T18:57:11Z","snapshot_observed_at":"2026-08-13T20:44:28.824685Z","submitted_at":"2020-09-07T17:59:25Z","title":"Measuring Massive Multitask Language Understanding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2009.03300","snapshot_observed_at":"2026-08-15T15:49:58.193411Z","title":"Measuring massive multitask language understanding","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2509.25148","last_updated":"2026-06-18T03:33:32Z","snapshot_observed_at":"2026-08-16T22:17:46.796368Z","submitted_at":"2025-09-29T17:53:09Z","title":"AAPA: Adversarially Anchored Preference Alignment for Post-Training of Large Language Models","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-15T15:49:58.193411Z"},"links":{"cited_paper":"/paper/2009.03300","citing_paper":"/paper/2509.25148"},"observation_digest":"sha256:f76d82872025eed1fdd87ec013af92030284ce2a6bdb4482848ec0a4a01b510d","observation_id":"f85c6f8f-bac3-47e1-b658-f4e938b68f5b","resolution":{"observed_at":"2026-08-15T15:49:58.193411Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:49:58.196925Z","title":"Mmlu-pro: A more robust and challenging multi-task language understanding benchmark","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.25148","last_updated":"2026-06-18T03:33:32Z","snapshot_observed_at":"2026-08-16T22:17:46.796368Z","submitted_at":"2025-09-29T17:53:09Z","title":"AAPA: Adversarially Anchored Preference Alignment for Post-Training of Large Language Models","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-15T15:49:58.196925Z"},"links":{"citing_paper":"/paper/2509.25148"},"observation_digest":"sha256:f25fd04c571be47e00ca829ea8d9804fe88eace8157b7f96090e3549019d7ee9","observation_id":"9ee6b06f-52d5-4c6c-b909-a4c1087c866c","resolution":{"observed_at":"2026-08-15T15:49:58.196925Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:49:58.199271Z","title":"Gpqa: A graduate-level google-proof q&a benchmark","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.25148","last_updated":"2026-06-18T03:33:32Z","snapshot_observed_at":"2026-08-16T22:17:46.796368Z","submitted_at":"2025-09-29T17:53:09Z","title":"AAPA: Adversarially Anchored Preference Alignment for Post-Training of Large Language Models","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-15T15:49:58.199271Z"},"links":{"citing_paper":"/paper/2509.25148"},"observation_digest":"sha256:865889bd7cbf107d3fcedc7556774426b92ee0a72f912929e5a340cbfabe9742","observation_id":"804d1d4c-4045-4555-a32d-91e48d1258b3","resolution":{"observed_at":"2026-08-15T15:49:58.199271Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2107.03374","last_updated":"2021-07-14T17:16:02Z","snapshot_observed_at":"2026-08-08T11:58:24.516369Z","submitted_at":"2021-07-07T17:41:24Z","title":"Evaluating Large Language Models Trained on Code","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2107.03374","snapshot_observed_at":"2026-08-15T15:49:58.201429Z","title":"Evaluating large language models trained on code","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.25148","last_updated":"2026-06-18T03:33:32Z","snapshot_observed_at":"2026-08-16T22:17:46.796368Z","submitted_at":"2025-09-29T17:53:09Z","title":"AAPA: Adversarially Anchored Preference Alignment for Post-Training of Large Language Models","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-15T15:49:58.201429Z"},"links":{"cited_paper":"/paper/2107.03374","citing_paper":"/paper/2509.25148"},"observation_digest":"sha256:bbf3bb0f0597ff50c11aad3a79235e8f827e5be0f85a799af1be39c8ad6535d3","observation_id":"b947f471-b0f1-400f-af49-1deb956d0934","resolution":{"observed_at":"2026-08-15T15:49:58.201429Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2108.07732","last_updated":"2021-08-16T03:57:30Z","snapshot_observed_at":"2026-08-15T17:40:38.050939Z","submitted_at":"2021-08-16T03:57:30Z","title":"Program Synthesis with Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2108.07732","snapshot_observed_at":"2026-08-15T15:49:58.205422Z","title":"Program synthesis with large language models","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.25148","last_updated":"2026-06-18T03:33:32Z","snapshot_observed_at":"2026-08-16T22:17:46.796368Z","submitted_at":"2025-09-29T17:53:09Z","title":"AAPA: Adversarially Anchored Preference Alignment for Post-Training of Large Language Models","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-15T15:49:58.205422Z"},"links":{"cited_paper":"/paper/2108.07732","citing_paper":"/paper/2509.25148"},"observation_digest":"sha256:673a9d1fd9d9b4a035d67122d0b95f59cbf692c74a17aba12c9eb9e59751d606","observation_id":"0979e746-9fab-4609-beee-71afeb3e1c52","resolution":{"observed_at":"2026-08-15T15:49:58.205422Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.14168","last_updated":"2021-11-18T00:23:45Z","snapshot_observed_at":"2026-08-14T02:43:01.480086Z","submitted_at":"2021-10-27T04:49:45Z","title":"Training Verifiers to Solve Math Word Problems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.14168","snapshot_observed_at":"2026-08-15T15:49:58.209138Z","title":"Training verifiers to solve math word problems","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.25148","last_updated":"2026-06-18T03:33:32Z","snapshot_observed_at":"2026-08-16T22:17:46.796368Z","submitted_at":"2025-09-29T17:53:09Z","title":"AAPA: Adversarially Anchored Preference Alignment for Post-Training of Large Language Models","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-15T15:49:58.209138Z"},"links":{"cited_paper":"/paper/2110.14168","citing_paper":"/paper/2509.25148"},"observation_digest":"sha256:5b2156c91b94b78dcd90a91d45c97f9601a29f834475e3cac58a2db015ad7a1e","observation_id":"6005055c-4816-4fd3-97ff-ab9624d64ae7","resolution":{"observed_at":"2026-08-15T15:49:58.209138Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:49:58.212019Z","title":"Let’s verify step by step","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.25148","last_updated":"2026-06-18T03:33:32Z","snapshot_observed_at":"2026-08-16T22:17:46.796368Z","submitted_at":"2025-09-29T17:53:09Z","title":"AAPA: Adversarially Anchored Preference Alignment for Post-Training of Large Language Models","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-15T15:49:58.212019Z"},"links":{"citing_paper":"/paper/2509.25148"},"observation_digest":"sha256:f7f45d8be1064b9c2a5b37bc8bb64001bf3686668cf9e2916a8cff8f0253f09e","observation_id":"b7ace46a-de22-4611-9396-116de9b0e6f1","resolution":{"observed_at":"2026-08-15T15:49:58.212019Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:49:58.696521Z","title":"Theoremqa: A theorem-driven question answering dataset","venue":null,"work_id":"4feb9d76-af29-45d1-8f28-393bdced611b","year":2023},"citing_paper":{"arxiv_id":"2509.25148","last_updated":"2026-06-18T03:33:32Z","snapshot_observed_at":"2026-08-16T22:17:46.796368Z","submitted_at":"2025-09-29T17:53:09Z","title":"AAPA: Adversarially Anchored Preference Alignment for Post-Training of Large Language Models","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-15T15:49:58.214895Z"},"links":{"citing_paper":"/paper/2509.25148"},"observation_digest":"sha256:bc3b8ebc7bb3f6e12ba571e5c650a848da88e842e5fe4399e14cc523252de643","observation_id":"82d5c9da-f8f5-4afa-8ba3-be80aee45ae7","resolution":{"observed_at":"2026-08-15T15:49:58.699052Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:49:58.217412Z","title":"Cmmlu: Measuring massive multitask language understanding in chinese, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.25148","last_updated":"2026-06-18T03:33:32Z","snapshot_observed_at":"2026-08-16T22:17:46.796368Z","submitted_at":"2025-09-29T17:53:09Z","title":"AAPA: Adversarially Anchored Preference Alignment for Post-Training of Large Language Models","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-15T15:49:58.217412Z"},"links":{"citing_paper":"/paper/2509.25148"},"observation_digest":"sha256:19205e32403e96cb97548dd56115ff8c02bdb2894e9254fe557fa10047e5d37e","observation_id":"62e6de16-ca27-4c2d-9a22-65beb8e7d1d8","resolution":{"observed_at":"2026-08-15T15:49:58.217412Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:49:58.685609Z","title":"C-eval: 12 A multi-level multi-discipline chinese evaluation suite for foundation models","venue":null,"work_id":"cade92b3-31a4-4ef0-97e3-f42c27ee546f","year":2023},"citing_paper":{"arxiv_id":"2509.25148","last_updated":"2026-06-18T03:33:32Z","snapshot_observed_at":"2026-08-16T22:17:46.796368Z","submitted_at":"2025-09-29T17:53:09Z","title":"AAPA: Adversarially Anchored Preference Alignment for Post-Training of Large Language Models","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-15T15:49:58.219886Z"},"links":{"citing_paper":"/paper/2509.25148"},"observation_digest":"sha256:b6611c6c70c7de650f055f747782a72fc24193678dd1447b4702455d904b78e9","observation_id":"e8fcaa28-bd44-49ef-b07e-4760195a12b7","resolution":{"observed_at":"2026-08-15T15:49:58.688924Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:49:58.222765Z","title":"Pre-trained policy discriminators are general reward models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.25148","last_updated":"2026-06-18T03:33:32Z","snapshot_observed_at":"2026-08-16T22:17:46.796368Z","submitted_at":"2025-09-29T17:53:09Z","title":"AAPA: Adversarially Anchored Preference Alignment for Post-Training of Large Language Models","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-15T15:49:58.222765Z"},"links":{"citing_paper":"/paper/2509.25148"},"observation_digest":"sha256:d67612c410e268992b793016ba3e69d71d8559742506d03a9e6fb830258a464f","observation_id":"ebb3d37d-99fb-4248-8f04-9148819eb483","resolution":{"observed_at":"2026-08-15T15:49:58.222765Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:49:58.679172Z","title":"Swift:a scalable lightweight infrastructure for fine-tuning, 2025","venue":null,"work_id":"a303a938-3cfb-44aa-9656-9061decc2936","year":2025},"citing_paper":{"arxiv_id":"2509.25148","last_updated":"2026-06-18T03:33:32Z","snapshot_observed_at":"2026-08-16T22:17:46.796368Z","submitted_at":"2025-09-29T17:53:09Z","title":"AAPA: Adversarially Anchored Preference Alignment for Post-Training of Large Language Models","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-15T15:49:58.225967Z"},"links":{"citing_paper":"/paper/2509.25148"},"observation_digest":"sha256:c8ee41b1ebfa1be64e790ea5a5ae12a5747002e1ad41d91901f225c7711ac196","observation_id":"324a8893-47d2-4c6a-a407-5dbb8abfa522","resolution":{"observed_at":"2026-08-15T15:49:58.681698Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:49:58.228336Z","title":"Hybridflow: A flexible and efficient rlhf framework","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.25148","last_updated":"2026-06-18T03:33:32Z","snapshot_observed_at":"2026-08-16T22:17:46.796368Z","submitted_at":"2025-09-29T17:53:09Z","title":"AAPA: Adversarially Anchored Preference Alignment for Post-Training of Large Language Models","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-15T15:49:58.228336Z"},"links":{"citing_paper":"/paper/2509.25148"},"observation_digest":"sha256:6e8e0e979b1386b5a827c219221bf2de004986198b10734c9a9d27dbbb2a9c14","observation_id":"ac153536-d7aa-48c5-9f68-870b934ff8ad","resolution":{"observed_at":"2026-08-15T15:49:58.228336Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:49:58.668227Z","title":"preference","venue":null,"work_id":"c4967d81-1b8f-4601-8ee8-7a4bca25ff78","year":2025},"citing_paper":{"arxiv_id":"2509.25148","last_updated":"2026-06-18T03:33:32Z","snapshot_observed_at":"2026-08-16T22:17:46.796368Z","submitted_at":"2025-09-29T17:53:09Z","title":"AAPA: Adversarially Anchored Preference Alignment for Post-Training of Large Language Models","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-15T15:49:58.230938Z"},"links":{"citing_paper":"/paper/2509.25148"},"observation_digest":"sha256:d3b085af3b31aae965dddd605e019796db2e64d541d3192f25f56c611d488e7b","observation_id":"f6522c83-15cd-4dc4-8a16-7f7d405c00b9","resolution":{"observed_at":"2026-08-15T15:49:58.671519Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:49:58.660899Z","title":null,"venue":null,"work_id":"bdb99f39-8ea3-4712-8f15-660882e6ea75","year":null},"citing_paper":{"arxiv_id":"2509.25148","last_updated":"2026-06-18T03:33:32Z","snapshot_observed_at":"2026-08-16T22:17:46.796368Z","submitted_at":"2025-09-29T17:53:09Z","title":"AAPA: Adversarially Anchored Preference Alignment for Post-Training of Large Language Models","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-15T15:49:58.234960Z"},"links":{"citing_paper":"/paper/2509.25148"},"observation_digest":"sha256:aa2b81027086aba66587d9b22b52fefdc3fd142b21c8640c5a5691333df22deb","observation_id":"5c6a21b2-369d-4393-95a4-8a8e50d8b392","resolution":{"observed_at":"2026-08-15T15:49:58.663350Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:49:58.652613Z","title":null,"venue":null,"work_id":"21e72ba5-c2a0-41f9-a079-b58aafaa87f8","year":null},"citing_paper":{"arxiv_id":"2509.25148","last_updated":"2026-06-18T03:33:32Z","snapshot_observed_at":"2026-08-16T22:17:46.796368Z","submitted_at":"2025-09-29T17:53:09Z","title":"AAPA: Adversarially Anchored Preference Alignment for Post-Training of Large Language Models","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-15T15:49:58.238143Z"},"links":{"citing_paper":"/paper/2509.25148"},"observation_digest":"sha256:2c10a3c916515e6331a9a9c17efff7b5119751b88a782df62f72bf6e8a3f9cff","observation_id":"b4ef34fe-e198-4a5d-950e-33621b0407d7","resolution":{"observed_at":"2026-08-15T15:49:58.655942Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:49:58.642769Z","title":"Due to the properties of the Dirac delta function, the integral is non-zero only at the single point y=y ∗","venue":null,"work_id":"6512b917-0b28-4c1b-8b14-5b22bb7bf2d7","year":null},"citing_paper":{"arxiv_id":"2509.25148","last_updated":"2026-06-18T03:33:32Z","snapshot_observed_at":"2026-08-16T22:17:46.796368Z","submitted_at":"2025-09-29T17:53:09Z","title":"AAPA: Adversarially Anchored Preference Alignment for Post-Training of Large Language Models","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-15T15:49:58.240961Z"},"links":{"citing_paper":"/paper/2509.25148"},"observation_digest":"sha256:a790adacad26f2107e33a47367db429807f9dfdef37010a7f0030f9756b716a1","observation_id":"35491afa-7d8e-49b3-b244-848509f433bb","resolution":{"observed_at":"2026-08-15T15:49:58.646748Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:49:58.636353Z","title":null,"venue":null,"work_id":"487d243d-cafa-4d48-962b-3d33e3d6e47a","year":null},"citing_paper":{"arxiv_id":"2509.25148","last_updated":"2026-06-18T03:33:32Z","snapshot_observed_at":"2026-08-16T22:17:46.796368Z","submitted_at":"2025-09-29T17:53:09Z","title":"AAPA: Adversarially Anchored Preference Alignment for Post-Training of Large Language Models","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-15T15:49:58.244479Z"},"links":{"citing_paper":"/paper/2509.25148"},"observation_digest":"sha256:b18af07dac6cfa54fb1739ce89c7158b9edcb57f80f3864666ad10b2ebe124f1","observation_id":"a999e21e-f008-46c7-bd41-fb96a7093c29","resolution":{"observed_at":"2026-08-15T15:49:58.638677Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:49:58.629599Z","title":null,"venue":null,"work_id":"afa3f1cf-53f0-4cb5-a645-0cc52eae3b8e","year":null},"citing_paper":{"arxiv_id":"2509.25148","last_updated":"2026-06-18T03:33:32Z","snapshot_observed_at":"2026-08-16T22:17:46.796368Z","submitted_at":"2025-09-29T17:53:09Z","title":"AAPA: Adversarially Anchored Preference Alignment for Post-Training of Large Language Models","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-15T15:49:58.247254Z"},"links":{"citing_paper":"/paper/2509.25148"},"observation_digest":"sha256:48c872868fe32abaa3137faf133572d10dfc900ac939a6610382422ff0c5a532","observation_id":"64913ba6-5505-4e22-8bbf-9bb3998ba328","resolution":{"observed_at":"2026-08-15T15:49:58.632107Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:49:58.622744Z","title":null,"venue":null,"work_id":"eb5f5d46-0582-434a-b4df-d33bcaa07c0a","year":null},"citing_paper":{"arxiv_id":"2509.25148","last_updated":"2026-06-18T03:33:32Z","snapshot_observed_at":"2026-08-16T22:17:46.796368Z","submitted_at":"2025-09-29T17:53:09Z","title":"AAPA: Adversarially Anchored Preference Alignment for Post-Training of Large Language Models","version":2},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-15T15:49:58.250724Z"},"links":{"citing_paper":"/paper/2509.25148"},"observation_digest":"sha256:978b5b9ccf890eec97d1708947a08d70eb2506700962db254f95092c9b8b522e","observation_id":"9bd36c44-6590-42cb-863f-e34b69f0c504","resolution":{"observed_at":"2026-08-15T15:49:58.625194Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:49:58.615796Z","title":"This provides a cohesive narrative for the entire post-training pipeline, viewing it not as a sequence of disparate steps but as a unified process","venue":null,"work_id":"2e11545d-5a21-4849-b8ba-cbf6f592d9f1","year":null},"citing_paper":{"arxiv_id":"2509.25148","last_updated":"2026-06-18T03:33:32Z","snapshot_observed_at":"2026-08-16T22:17:46.796368Z","submitted_at":"2025-09-29T17:53:09Z","title":"AAPA: Adversarially Anchored Preference Alignment for Post-Training of Large Language Models","version":2},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-15T15:49:58.254776Z"},"links":{"citing_paper":"/paper/2509.25148"},"observation_digest":"sha256:7ab898a8a16e10e9dfdfb974906c46b05988c7f957277210ac89a677593d4d58","observation_id":"a35edc2e-255f-43c8-a8bc-2e8c9c63e1c1","resolution":{"observed_at":"2026-08-15T15:49:58.618467Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"5743.9152","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:49:58.324979Z","title":"winner\" (preferred) response andyl is the","venue":null,"work_id":"65aba26a-7f81-4a8b-9865-abb35102c27d","year":null},"citing_paper":{"arxiv_id":"2509.25148","last_updated":"2026-06-18T03:33:32Z","snapshot_observed_at":"2026-08-16T22:17:46.796368Z","submitted_at":"2025-09-29T17:53:09Z","title":"AAPA: Adversarially Anchored Preference Alignment for Post-Training of Large Language Models","version":2},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-15T15:49:58.258118Z"},"links":{"citing_paper":"/paper/2509.25148"},"observation_digest":"sha256:bef6921d54b14eb4b09b56fdfc29c9ef6575701f014dd37c75742caf300f6eb2","observation_id":"d01692d6-8b7b-4e18-935f-1834b976261b","resolution":{"observed_at":"2026-08-15T15:49:58.330875Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.15226","last_updated":"2024-10-22T18:54:23Z","snapshot_observed_at":"2026-08-16T13:07:44.720730Z","submitted_at":"2024-10-19T22:14:07Z","title":"On the Diversity of Synthetic Data and its Impact on Training Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.15226","snapshot_observed_at":"2026-08-15T15:49:58.116911Z","title":"org/abs/2410.15226, 2016","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2509.25148","last_updated":"2026-06-18T03:33:32Z","snapshot_observed_at":"2026-08-16T22:17:46.796368Z","submitted_at":"2025-09-29T17:53:09Z","title":"AAPA: Adversarially Anchored Preference Alignment for Post-Training of Large Language Models","version":2},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-15T15:49:58.116911Z"},"links":{"cited_paper":"/paper/2410.15226","citing_paper":"/paper/2509.25148"},"observation_digest":"sha256:47681e04ce05604a06857b31f33714a9609fa5146f9651699523416fac7c8b7a","observation_id":"829c96dc-3465-4610-bb3e-b7248a0a1296","resolution":{"observed_at":"2026-08-15T15:49:58.116911Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2509.25148","last_updated":"2026-06-18T03:33:32Z","latest_version":2,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-16T22:17:46.796368Z","submitted_at":"2025-09-29T17:53:09Z","title":"AAPA: Adversarially Anchored Preference Alignment for Post-Training of Large Language Models"},"reference_resolution":{"displayed":64,"state_counts":{"malformed_identifier":1,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":47,"verified_exact":0,"verified_fuzzy":15},"total_outbound_references":64},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"thesis":"As of 19 August 2026, this Paper Citation Record lists 64 of 64 outbound references and 1 inbound Pith citation observation for arXiv:2509.25148."}