{"as_of":"2026-08-14T08:20:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:e2a1757e44a79e7a303f59954da7b0f5ae70a6df93bc510648013c907553a7d3","coverage":[{"denominator":49,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":49,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T19:14:37.117468Z","state":"measured"},{"denominator":51,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":51,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-14T06:32:32.682623+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T19:37:39.875926Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-19T06:12:07.140554Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2411.10914","last_updated":"2025-02-20T06:07:41Z","snapshot_observed_at":"2026-08-13T06:34:56.722164Z","submitted_at":"2024-11-16T23:53:27Z","title":"BPO: Towards Balanced Preference Optimization between Knowledge Breadth and Depth in Alignment","version":2},"cited_work":{"arxiv_id":"2411.10914","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2411.10914","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Bpo: Towards balanced preference optimization between knowledge breadth and depth in alignment","venue":null,"work_id":"521ba4a8-3934-4bb7-8d32-20cbfd069b7e","year":2024},"citing_paper":{"arxiv_id":"2507.05179","last_updated":"2026-05-31T04:19:46Z","snapshot_observed_at":"2026-08-06T19:27:53.110737Z","submitted_at":"2025-07-07T16:34:28Z","title":"From Fragments to Facts: A Curriculum-Driven DPO Approach for Generating Hindi News Veracity Explanations","version":5},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-05-19T06:09:26.269452Z"},"links":{"cited_paper":"/paper/2411.10914","citing_paper":"/paper/2507.05179"},"observation_digest":"sha256:b8669f10422ebe64f7c0b60fe74bd94f787a546f8e6be188e4c349b32496f7a1","observation_id":"bfa35949-57d6-484d-b57f-992a1b64dab6","resolution":{"observed_at":"2026-05-19T06:12:07.142754Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.10914","last_updated":"2025-02-20T06:07:41Z","snapshot_observed_at":"2026-08-13T06:34:56.722164Z","submitted_at":"2024-11-16T23:53:27Z","title":"BPO: Towards Balanced Preference Optimization between Knowledge Breadth and Depth in Alignment","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.10914","snapshot_observed_at":"2026-08-06T19:37:39.875926Z","title":"Asso- ciation for Computational Linguistics","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.05179","last_updated":"2026-05-31T04:19:46Z","snapshot_observed_at":"2026-08-06T19:27:53.110737Z","submitted_at":"2025-07-07T16:34:28Z","title":"From Fragments to Facts: A Curriculum-Driven DPO Approach for Generating Hindi News Veracity Explanations","version":6},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T19:37:39.875926Z"},"links":{"cited_paper":"/paper/2411.10914","citing_paper":"/paper/2507.05179"},"observation_digest":"sha256:a0a52e84a1285c518b2b6876ec1a9efb194c268d1d50ed9375a595947e0ce0bb","observation_id":"32eca10d-4bae-43eb-851b-42e3a8ed6445","resolution":{"observed_at":"2026-08-06T19:37:39.875926Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2411.10914/citation-record","integrity":"/paper/2411.10914/integrity","json":"/paper/2411.10914/citation-record.json","paper":"/paper/2411.10914"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2402.16827","last_updated":"2024-08-02T17:59:31Z","snapshot_observed_at":"2026-08-13T04:09:47.874806Z","submitted_at":"2024-02-26T18:54:35Z","title":"A Survey on Data Selection for Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.16827","snapshot_observed_at":"2026-08-12T19:14:36.907006Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.10914","last_updated":"2025-02-20T06:07:41Z","snapshot_observed_at":"2026-08-13T06:34:56.722164Z","submitted_at":"2024-11-16T23:53:27Z","title":"BPO: Towards Balanced Preference Optimization between Knowledge Breadth and Depth in Alignment","version":2},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-12T19:14:36.907006Z"},"links":{"cited_paper":"/paper/2402.16827","citing_paper":"/paper/2411.10914"},"observation_digest":"sha256:7f463ce854102e03a57b76b640af321f67e308a14395553d135e7abb15a24927","observation_id":"b0ec019e-8f45-4012-b076-58691db7ddeb","resolution":{"observed_at":"2026-08-12T19:14:36.907006Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.05862","last_updated":"2022-04-12T15:02:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-04-12T15:02:38Z","title":"Training a Helpful and Harmless Assistant with Reinforcement Learning from Human Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.05862","snapshot_observed_at":"2026-08-12T19:14:36.911802Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.10914","last_updated":"2025-02-20T06:07:41Z","snapshot_observed_at":"2026-08-13T06:34:56.722164Z","submitted_at":"2024-11-16T23:53:27Z","title":"BPO: Towards Balanced Preference Optimization between Knowledge Breadth and Depth in Alignment","version":2},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-12T19:14:36.911802Z"},"links":{"cited_paper":"/paper/2204.05862","citing_paper":"/paper/2411.10914"},"observation_digest":"sha256:d4dc2a1fa80058c6a20fa4be688ac5a5e8f3fab18af19e32c9259249f47ea0ff","observation_id":"c3154b58-ab12-4254-8c5d-afc49900c419","resolution":{"observed_at":"2026-08-12T19:14:36.911802Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:14:37.639996Z","title":null,"venue":null,"work_id":"57f77ce0-10c5-4af6-8d06-0ab5b4f25138","year":2024},"citing_paper":{"arxiv_id":"2411.10914","last_updated":"2025-02-20T06:07:41Z","snapshot_observed_at":"2026-08-13T06:34:56.722164Z","submitted_at":"2024-11-16T23:53:27Z","title":"BPO: Towards Balanced Preference Optimization between Knowledge Breadth and Depth in Alignment","version":2},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-12T19:14:36.916115Z"},"links":{"citing_paper":"/paper/2411.10914"},"observation_digest":"sha256:6796808f897480d8487c8c50399ee0719845bc89f042c514017e9c13ee462cc4","observation_id":"470b6e01-bc63-4cb0-ac21-1cd26bac9118","resolution":{"observed_at":"2026-08-12T19:14:37.643972Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:14:36.919782Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2411.10914","last_updated":"2025-02-20T06:07:41Z","snapshot_observed_at":"2026-08-13T06:34:56.722164Z","submitted_at":"2024-11-16T23:53:27Z","title":"BPO: Towards Balanced Preference Optimization between Knowledge Breadth and Depth in Alignment","version":2},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-12T19:14:36.919782Z"},"links":{"citing_paper":"/paper/2411.10914"},"observation_digest":"sha256:efbfd568609b57cf4136a79f2e70b350abf9c6bf74479e2065308044bc5009b4","observation_id":"93c2bbe0-6ec2-4180-ab29-6b3781f3c3df","resolution":{"observed_at":"2026-08-12T19:14:36.919782Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:14:36.924430Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.10914","last_updated":"2025-02-20T06:07:41Z","snapshot_observed_at":"2026-08-13T06:34:56.722164Z","submitted_at":"2024-11-16T23:53:27Z","title":"BPO: Towards Balanced Preference Optimization between Knowledge Breadth and Depth in Alignment","version":2},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-12T19:14:36.924430Z"},"links":{"citing_paper":"/paper/2411.10914"},"observation_digest":"sha256:3a6d0f1f0d3d29c80d9488d0d9ce8fed67143dbc13e02eed15f61dd46ecb8630","observation_id":"45604d82-2d11-4c4a-84b6-6ef30e438afb","resolution":{"observed_at":"2026-08-12T19:14:36.924430Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:14:36.928235Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.10914","last_updated":"2025-02-20T06:07:41Z","snapshot_observed_at":"2026-08-13T06:34:56.722164Z","submitted_at":"2024-11-16T23:53:27Z","title":"BPO: Towards Balanced Preference Optimization between Knowledge Breadth and Depth in Alignment","version":2},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-12T19:14:36.928235Z"},"links":{"citing_paper":"/paper/2411.10914"},"observation_digest":"sha256:e7a6b8192f9ca7c07341af043fc3ebc0aa12b916e63ccc42c44f5f030a6bed3a","observation_id":"e2519ffd-99eb-4bb3-a109-e7e8707deb90","resolution":{"observed_at":"2026-08-12T19:14:36.928235Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.12773","last_updated":"2023-10-19T14:22:03Z","snapshot_observed_at":"2026-08-02T16:56:38.535065Z","submitted_at":"2023-10-19T14:22:03Z","title":"Safe RLHF: Safe Reinforcement Learning from Human Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.12773","snapshot_observed_at":"2026-08-12T19:14:36.932277Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.10914","last_updated":"2025-02-20T06:07:41Z","snapshot_observed_at":"2026-08-13T06:34:56.722164Z","submitted_at":"2024-11-16T23:53:27Z","title":"BPO: Towards Balanced Preference Optimization between Knowledge Breadth and Depth in Alignment","version":2},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-12T19:14:36.932277Z"},"links":{"cited_paper":"/paper/2310.12773","citing_paper":"/paper/2411.10914"},"observation_digest":"sha256:d65b1a64b65694874d0e06ab5f7af17a64c81e41b2f6c1e74e66b30b60216ae0","observation_id":"5362d29f-2207-4fc8-b396-47188baba437","resolution":{"observed_at":"2026-08-12T19:14:36.932277Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-13T17:20:44.002518Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-12T19:14:36.936125Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.10914","last_updated":"2025-02-20T06:07:41Z","snapshot_observed_at":"2026-08-13T06:34:56.722164Z","submitted_at":"2024-11-16T23:53:27Z","title":"BPO: Towards Balanced Preference Optimization between Knowledge Breadth and Depth in Alignment","version":2},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-12T19:14:36.936125Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2411.10914"},"observation_digest":"sha256:6c09a32c3b16733a28c2b28de1de9a98c09a1f757f4c9df871daaf06874b4942","observation_id":"a5b4ffa9-9d0d-4952-a528-318a1175749e","resolution":{"observed_at":"2026-08-12T19:14:36.936125Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.04475","last_updated":"2025-03-10T09:27:03Z","snapshot_observed_at":"2026-07-06T17:56:23.317089Z","submitted_at":"2024-04-06T02:29:02Z","title":"Length-Controlled AlpacaEval: A Simple Way to Debias Automatic Evaluators","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.04475","snapshot_observed_at":"2026-08-12T19:14:36.940399Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.10914","last_updated":"2025-02-20T06:07:41Z","snapshot_observed_at":"2026-08-13T06:34:56.722164Z","submitted_at":"2024-11-16T23:53:27Z","title":"BPO: Towards Balanced Preference Optimization between Knowledge Breadth and Depth in Alignment","version":2},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-12T19:14:36.940399Z"},"links":{"cited_paper":"/paper/2404.04475","citing_paper":"/paper/2411.10914"},"observation_digest":"sha256:befe371a1a13a2ece99e9b1dfc11c088aff286eb1cc7b2ab8d0f4d4c3bc7d0a2","observation_id":"38aa032c-7cac-4485-9382-77a7bd88c691","resolution":{"observed_at":"2026-08-12T19:14:36.940399Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.01306","last_updated":"2024-11-19T18:12:45Z","snapshot_observed_at":"2026-08-12T21:18:02.964833Z","submitted_at":"2024-02-02T10:53:36Z","title":"KTO: Model Alignment as Prospect Theoretic Optimization","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.01306","snapshot_observed_at":"2026-08-12T19:14:36.944535Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.10914","last_updated":"2025-02-20T06:07:41Z","snapshot_observed_at":"2026-08-13T06:34:56.722164Z","submitted_at":"2024-11-16T23:53:27Z","title":"BPO: Towards Balanced Preference Optimization between Knowledge Breadth and Depth in Alignment","version":2},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-12T19:14:36.944535Z"},"links":{"cited_paper":"/paper/2402.01306","citing_paper":"/paper/2411.10914"},"observation_digest":"sha256:e764fab791e55a42e70723bd4a7d5fb744b43f145df2ccabd136902996be41c9","observation_id":"b62cacff-d5d7-435d-ad73-8a2573ce2ebd","resolution":{"observed_at":"2026-08-12T19:14:36.944535Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.02554","last_updated":"2023-04-05T16:17:32Z","snapshot_observed_at":"2026-08-13T12:08:38.240705Z","submitted_at":"2023-04-05T16:17:32Z","title":"Human-like Summarization Evaluation with ChatGPT","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.02554","snapshot_observed_at":"2026-08-12T19:14:36.948222Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.10914","last_updated":"2025-02-20T06:07:41Z","snapshot_observed_at":"2026-08-13T06:34:56.722164Z","submitted_at":"2024-11-16T23:53:27Z","title":"BPO: Towards Balanced Preference Optimization between Knowledge Breadth and Depth in Alignment","version":2},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-12T19:14:36.948222Z"},"links":{"cited_paper":"/paper/2304.02554","citing_paper":"/paper/2411.10914"},"observation_digest":"sha256:cba49c95907e416494482e323cf5ccb370d6dd14b295d0e2f0a4d167e7cf197b","observation_id":"0024ca61-e16a-438e-874c-caa354ecc0a7","resolution":{"observed_at":"2026-08-12T19:14:36.948222Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:14:37.606304Z","title":null,"venue":null,"work_id":"5d0270b2-fdc6-45a5-b38b-0d5e6c3b344c","year":2023},"citing_paper":{"arxiv_id":"2411.10914","last_updated":"2025-02-20T06:07:41Z","snapshot_observed_at":"2026-08-13T06:34:56.722164Z","submitted_at":"2024-11-16T23:53:27Z","title":"BPO: Towards Balanced Preference Optimization between Knowledge Breadth and Depth in Alignment","version":2},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-12T19:14:36.952159Z"},"links":{"citing_paper":"/paper/2411.10914"},"observation_digest":"sha256:21768d5e96029ca80857b78b7a7984be40e6f0a46019b98232008e32ac215412","observation_id":"e828a1d3-e343-4d26-bb7a-f2873e5832e2","resolution":{"observed_at":"2026-08-12T19:14:37.611067Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2106.09685","last_updated":"2021-10-16T18:40:34Z","snapshot_observed_at":"2026-08-11T08:20:29.798517Z","submitted_at":"2021-06-17T17:37:18Z","title":"LoRA: Low-Rank Adaptation of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.09685","snapshot_observed_at":"2026-08-12T19:14:36.955773Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.10914","last_updated":"2025-02-20T06:07:41Z","snapshot_observed_at":"2026-08-13T06:34:56.722164Z","submitted_at":"2024-11-16T23:53:27Z","title":"BPO: Towards Balanced Preference Optimization between Knowledge Breadth and Depth in Alignment","version":2},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-12T19:14:36.955773Z"},"links":{"cited_paper":"/paper/2106.09685","citing_paper":"/paper/2411.10914"},"observation_digest":"sha256:abba252f3eb5f16ce5920e58c3215caf8d7b05db34ee6af55dc76cac6adc469f","observation_id":"0713a90d-c316-4a3b-99b7-5bc41834f415","resolution":{"observed_at":"2026-08-12T19:14:36.955773Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:14:37.594220Z","title":null,"venue":null,"work_id":"da1e2636-dfe7-4ce0-a309-0c9f4557e62c","year":1984},"citing_paper":{"arxiv_id":"2411.10914","last_updated":"2025-02-20T06:07:41Z","snapshot_observed_at":"2026-08-13T06:34:56.722164Z","submitted_at":"2024-11-16T23:53:27Z","title":"BPO: Towards Balanced Preference Optimization between Knowledge Breadth and Depth in Alignment","version":2},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-12T19:14:36.959518Z"},"links":{"citing_paper":"/paper/2411.10914"},"observation_digest":"sha256:a14d568eb82bbf3bca9594a96d7739cd6f2907eb2adc4037f5d98d7bc964615d","observation_id":"949183c7-e3f5-4fc1-8f41-806b3bf59bd8","resolution":{"observed_at":"2026-08-12T19:14:37.598659Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.14648","last_updated":"2024-03-20T02:21:20Z","snapshot_observed_at":"2026-08-13T05:18:14.435924Z","submitted_at":"2023-11-24T18:29:50Z","title":"Calibrated Language Models Must Hallucinate","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.14648","snapshot_observed_at":"2026-08-12T19:14:36.963035Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.10914","last_updated":"2025-02-20T06:07:41Z","snapshot_observed_at":"2026-08-13T06:34:56.722164Z","submitted_at":"2024-11-16T23:53:27Z","title":"BPO: Towards Balanced Preference Optimization between Knowledge Breadth and Depth in Alignment","version":2},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-12T19:14:36.963035Z"},"links":{"cited_paper":"/paper/2311.14648","citing_paper":"/paper/2411.10914"},"observation_digest":"sha256:53eaeb7f44c0f90113fab4b260a48ac93befc2ecd664ac6cfc954a94e6c6c635","observation_id":"ef45d9f0-f162-4f56-90f9-db7d5747802a","resolution":{"observed_at":"2026-08-12T19:14:36.963035Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.10038","last_updated":"2024-03-30T16:10:47Z","snapshot_observed_at":"2026-08-13T04:18:14.661769Z","submitted_at":"2024-02-15T16:00:58Z","title":"RS-DPO: A Hybrid Rejection Sampling and Direct Preference Optimization Method for Alignment of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.10038","snapshot_observed_at":"2026-08-12T19:14:36.971420Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.10914","last_updated":"2025-02-20T06:07:41Z","snapshot_observed_at":"2026-08-13T06:34:56.722164Z","submitted_at":"2024-11-16T23:53:27Z","title":"BPO: Towards Balanced Preference Optimization between Knowledge Breadth and Depth in Alignment","version":2},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-12T19:14:36.971420Z"},"links":{"cited_paper":"/paper/2402.10038","citing_paper":"/paper/2411.10914"},"observation_digest":"sha256:a4c3654ea81b84380cd6fd6c34952891ae6b796e68663b554fa36504514f46d6","observation_id":"3f7c0633-7a0a-4f16-b7f0-ee028ace3e3b","resolution":{"observed_at":"2026-08-12T19:14:36.971420Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1412.6980","last_updated":"2017-01-30T01:27:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2014-12-22T13:54:29Z","title":"Adam: A Method for Stochastic Optimization","version":9},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1412.6980","snapshot_observed_at":"2026-08-12T19:14:36.975613Z","title":null,"venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2411.10914","last_updated":"2025-02-20T06:07:41Z","snapshot_observed_at":"2026-08-13T06:34:56.722164Z","submitted_at":"2024-11-16T23:53:27Z","title":"BPO: Towards Balanced Preference Optimization between Knowledge Breadth and Depth in Alignment","version":2},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-12T19:14:36.975613Z"},"links":{"cited_paper":"/paper/1412.6980","citing_paper":"/paper/2411.10914"},"observation_digest":"sha256:d4dccd2e09b3188f0f20cd6fc6b2906ad5464bfdc6d2589dc33711af76076719","observation_id":"87bc80b6-af2c-4e9c-bc38-ea8157032dd7","resolution":{"observed_at":"2026-08-12T19:14:36.975613Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.04819","last_updated":"2024-10-17T18:31:13Z","snapshot_observed_at":"2026-08-13T00:12:35.964311Z","submitted_at":"2024-05-08T05:38:20Z","title":"DALK: Dynamic Co-Augmentation of LLMs and KG to answer Alzheimer's Disease Questions with Scientific Literature","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.04819","snapshot_observed_at":"2026-08-12T19:14:36.979632Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.10914","last_updated":"2025-02-20T06:07:41Z","snapshot_observed_at":"2026-08-13T06:34:56.722164Z","submitted_at":"2024-11-16T23:53:27Z","title":"BPO: Towards Balanced Preference Optimization between Knowledge Breadth and Depth in Alignment","version":2},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-12T19:14:36.979632Z"},"links":{"cited_paper":"/paper/2405.04819","citing_paper":"/paper/2411.10914"},"observation_digest":"sha256:546f7d03c30e02821474d2e6b512943e3a107d47518305cec4dbaf3ae81b4aba","observation_id":"14f963a1-910c-4938-9a68-620575c4cdb5","resolution":{"observed_at":"2026-08-12T19:14:36.979632Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11939","last_updated":"2024-10-14T18:11:58Z","snapshot_observed_at":"2026-08-11T09:34:38.920981Z","submitted_at":"2024-06-17T17:26:10Z","title":"From Crowdsourced Data to High-Quality Benchmarks: Arena-Hard and BenchBuilder Pipeline","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.11939","snapshot_observed_at":"2026-08-12T19:14:36.983735Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.10914","last_updated":"2025-02-20T06:07:41Z","snapshot_observed_at":"2026-08-13T06:34:56.722164Z","submitted_at":"2024-11-16T23:53:27Z","title":"BPO: Towards Balanced Preference Optimization between Knowledge Breadth and Depth in Alignment","version":2},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-12T19:14:36.983735Z"},"links":{"cited_paper":"/paper/2406.11939","citing_paper":"/paper/2411.10914"},"observation_digest":"sha256:4a96ed1247d11f450525bd4570ebb0ce4fe322b11574ea0d1e68770e70db1e11","observation_id":"6b7457da-6aca-4b07-8be8-af1734fffd41","resolution":{"observed_at":"2026-08-12T19:14:36.983735Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:14:36.987699Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.10914","last_updated":"2025-02-20T06:07:41Z","snapshot_observed_at":"2026-08-13T06:34:56.722164Z","submitted_at":"2024-11-16T23:53:27Z","title":"BPO: Towards Balanced Preference Optimization between Knowledge Breadth and Depth in Alignment","version":2},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-12T19:14:36.987699Z"},"links":{"citing_paper":"/paper/2411.10914"},"observation_digest":"sha256:bebe9e494b99e250dbd8b6ce33c3a31d0da207b0efe155d0dc095a13af6aca77","observation_id":"4e6bdf45-8520-4bbf-8dcb-e76b1121a180","resolution":{"observed_at":"2026-08-12T19:14:36.987699Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.06657","last_updated":"2024-01-23T23:16:11Z","snapshot_observed_at":"2026-08-13T10:14:47.864569Z","submitted_at":"2023-09-13T01:07:25Z","title":"Statistical Rejection Sampling Improves Preference Optimization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.06657","snapshot_observed_at":"2026-08-12T19:14:36.991382Z","title":"Liu, and Jialu Liu","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.10914","last_updated":"2025-02-20T06:07:41Z","snapshot_observed_at":"2026-08-13T06:34:56.722164Z","submitted_at":"2024-11-16T23:53:27Z","title":"BPO: Towards Balanced Preference Optimization between Knowledge Breadth and Depth in Alignment","version":2},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-12T19:14:36.991382Z"},"links":{"cited_paper":"/paper/2309.06657","citing_paper":"/paper/2411.10914"},"observation_digest":"sha256:39bb75f6ab0a8b08b87dc3aaea26f0b693a149f55d15f567b03f64cfd0ee1e23","observation_id":"b530734b-bf51-43c2-bb55-b2345dbb6d04","resolution":{"observed_at":"2026-08-12T19:14:36.991382Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.15685","last_updated":"2024-04-16T02:46:58Z","snapshot_observed_at":"2026-08-13T04:54:16.874411Z","submitted_at":"2023-12-25T10:29:28Z","title":"What Makes Good Data for Alignment? A Comprehensive Study of Automatic Data Selection in Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.15685","snapshot_observed_at":"2026-08-12T19:14:36.995369Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.10914","last_updated":"2025-02-20T06:07:41Z","snapshot_observed_at":"2026-08-13T06:34:56.722164Z","submitted_at":"2024-11-16T23:53:27Z","title":"BPO: Towards Balanced Preference Optimization between Knowledge Breadth and Depth in Alignment","version":2},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-12T19:14:36.995369Z"},"links":{"cited_paper":"/paper/2312.15685","citing_paper":"/paper/2411.10914"},"observation_digest":"sha256:a1ce36eee1212cd06079ffc02fca3b268dcb6c321b2099d04feae3ffda4c6f6c","observation_id":"8dce8b1e-2382-4c61-a350-b2c549601292","resolution":{"observed_at":"2026-08-12T19:14:36.995369Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.14734","last_updated":"2024-11-01T20:05:19Z","snapshot_observed_at":"2026-08-12T23:59:40.308872Z","submitted_at":"2024-05-23T16:01:46Z","title":"SimPO: Simple Preference Optimization with a Reference-Free Reward","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.14734","snapshot_observed_at":"2026-08-12T19:14:36.999314Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.10914","last_updated":"2025-02-20T06:07:41Z","snapshot_observed_at":"2026-08-13T06:34:56.722164Z","submitted_at":"2024-11-16T23:53:27Z","title":"BPO: Towards Balanced Preference Optimization between Knowledge Breadth and Depth in Alignment","version":2},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-12T19:14:36.999314Z"},"links":{"cited_paper":"/paper/2405.14734","citing_paper":"/paper/2411.10914"},"observation_digest":"sha256:d03043a1f89b250214eca1233aaa9263b08eb07b860bcbe42da17e3beb8f0503","observation_id":"70e7b513-cee4-435a-b139-692ff894730e","resolution":{"observed_at":"2026-08-12T19:14:36.999314Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.13846","last_updated":"2024-12-03T17:22:01Z","snapshot_observed_at":"2026-08-13T07:05:13.412421Z","submitted_at":"2024-04-22T03:05:19Z","title":"Filtered Direct Preference Optimization","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.13846","snapshot_observed_at":"2026-08-12T19:14:37.003269Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.10914","last_updated":"2025-02-20T06:07:41Z","snapshot_observed_at":"2026-08-13T06:34:56.722164Z","submitted_at":"2024-11-16T23:53:27Z","title":"BPO: Towards Balanced Preference Optimization between Knowledge Breadth and Depth in Alignment","version":2},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-12T19:14:37.003269Z"},"links":{"cited_paper":"/paper/2404.13846","citing_paper":"/paper/2411.10914"},"observation_digest":"sha256:5a31e155f10b4d457a7bda10c663dd282729f89bb810ec6cf813bca7249aeb67","observation_id":"74eb6b19-7226-4387-b346-8100999209c1","resolution":{"observed_at":"2026-08-12T19:14:37.003269Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.07230","last_updated":"2024-11-08T08:55:00Z","snapshot_observed_at":"2026-08-13T00:57:09.814747Z","submitted_at":"2024-03-12T00:58:19Z","title":"Curry-DPO: Enhancing Alignment using Curriculum Learning & Ranked Preferences","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.07230","snapshot_observed_at":"2026-08-12T19:14:37.015126Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.10914","last_updated":"2025-02-20T06:07:41Z","snapshot_observed_at":"2026-08-13T06:34:56.722164Z","submitted_at":"2024-11-16T23:53:27Z","title":"BPO: Towards Balanced Preference Optimization between Knowledge Breadth and Depth in Alignment","version":2},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-12T19:14:37.015126Z"},"links":{"cited_paper":"/paper/2403.07230","citing_paper":"/paper/2411.10914"},"observation_digest":"sha256:df7a458fe079aaed847ec88aca4cce97b7121fd8c52fababdb545224e7f4acf4","observation_id":"d2439acd-c0e0-4144-bd67-41d12f5b2700","resolution":{"observed_at":"2026-08-12T19:14:37.015126Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.15112","last_updated":"2024-12-02T19:26:56Z","snapshot_observed_at":"2026-08-13T00:48:00.214454Z","submitted_at":"2024-03-22T11:08:48Z","title":"Text Clustering with Large Language Model Embeddings","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.15112","snapshot_observed_at":"2026-08-12T19:14:37.019154Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.10914","last_updated":"2025-02-20T06:07:41Z","snapshot_observed_at":"2026-08-13T06:34:56.722164Z","submitted_at":"2024-11-16T23:53:27Z","title":"BPO: Towards Balanced Preference Optimization between Knowledge Breadth and Depth in Alignment","version":2},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-12T19:14:37.019154Z"},"links":{"cited_paper":"/paper/2403.15112","citing_paper":"/paper/2411.10914"},"observation_digest":"sha256:8407ca614ac96ada194c2643845fc50759b16c7aa4f81020b2350ccccafdb77b","observation_id":"ea4c1eca-3c78-4ff6-9d3d-acef119a17fe","resolution":{"observed_at":"2026-08-12T19:14:37.019154Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:14:37.023460Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2411.10914","last_updated":"2025-02-20T06:07:41Z","snapshot_observed_at":"2026-08-13T06:34:56.722164Z","submitted_at":"2024-11-16T23:53:27Z","title":"BPO: Towards Balanced Preference Optimization between Knowledge Breadth and Depth in Alignment","version":2},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-12T19:14:37.023460Z"},"links":{"citing_paper":"/paper/2411.10914"},"observation_digest":"sha256:7c9d86c25cb56db056084939f549b7720538aa30e9787d02e5b8d28589c3e573","observation_id":"3f6616da-87e0-4958-b31f-57c03c22d5b2","resolution":{"observed_at":"2026-08-12T19:14:37.023460Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:14:37.027162Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.10914","last_updated":"2025-02-20T06:07:41Z","snapshot_observed_at":"2026-08-13T06:34:56.722164Z","submitted_at":"2024-11-16T23:53:27Z","title":"BPO: Towards Balanced Preference Optimization between Knowledge Breadth and Depth in Alignment","version":2},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-12T19:14:37.027162Z"},"links":{"citing_paper":"/paper/2411.10914"},"observation_digest":"sha256:657fc8a995fcdbda550719122b6b1a2b5fc208c1666fe2f1526efe5dd6768915","observation_id":"ecf408ba-8b58-4cb2-9a53-57592c1747f5","resolution":{"observed_at":"2026-08-12T19:14:37.027162Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.14723","last_updated":"2025-02-08T16:29:14Z","snapshot_observed_at":"2026-08-13T17:28:22.439752Z","submitted_at":"2024-04-23T03:55:01Z","title":"Insights into Alignment: Evaluating DPO and its Variants Across Multiple Tasks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.14723","snapshot_observed_at":"2026-08-12T19:14:37.031609Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.10914","last_updated":"2025-02-20T06:07:41Z","snapshot_observed_at":"2026-08-13T06:34:56.722164Z","submitted_at":"2024-11-16T23:53:27Z","title":"BPO: Towards Balanced Preference Optimization between Knowledge Breadth and Depth in Alignment","version":2},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-12T19:14:37.031609Z"},"links":{"cited_paper":"/paper/2404.14723","citing_paper":"/paper/2411.10914"},"observation_digest":"sha256:1ef0712cd861b2e7cb126de9bdf5df4c02732036e9b76dd4d854e2da9d3a99d5","observation_id":"f0c3a59b-ed83-4baf-9d37-c742de0a9c58","resolution":{"observed_at":"2026-08-12T19:14:37.031609Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-12T19:14:37.035918Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2411.10914","last_updated":"2025-02-20T06:07:41Z","snapshot_observed_at":"2026-08-13T06:34:56.722164Z","submitted_at":"2024-11-16T23:53:27Z","title":"BPO: Towards Balanced Preference Optimization between Knowledge Breadth and Depth in Alignment","version":2},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-12T19:14:37.035918Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2411.10914"},"observation_digest":"sha256:96b337c3d07f516bbafb9d50501c720950450e6d38532893769b0feb51256e59","observation_id":"47b066ec-1053-4320-a8ee-bed034af49e5","resolution":{"observed_at":"2026-08-12T19:14:37.035918Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.03825","last_updated":"2024-05-15T12:06:31Z","snapshot_observed_at":"2026-07-06T16:03:34.432602Z","submitted_at":"2023-08-07T16:55:20Z","title":"\"Do Anything Now\": Characterizing and Evaluating In-The-Wild Jailbreak Prompts on Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.03825","snapshot_observed_at":"2026-08-12T19:14:37.040457Z","title":"do anything now","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.10914","last_updated":"2025-02-20T06:07:41Z","snapshot_observed_at":"2026-08-13T06:34:56.722164Z","submitted_at":"2024-11-16T23:53:27Z","title":"BPO: Towards Balanced Preference Optimization between Knowledge Breadth and Depth in Alignment","version":2},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-12T19:14:37.040457Z"},"links":{"cited_paper":"/paper/2308.03825","citing_paper":"/paper/2411.10914"},"observation_digest":"sha256:32a67c9bb91946d09b05128381edde745c459c4d7576dab532a4a1042c5ff703","observation_id":"96594f66-9ded-4b99-969d-71a73a8165ed","resolution":{"observed_at":"2026-08-12T19:14:37.040457Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.11124","last_updated":"2024-03-30T16:48:16Z","snapshot_observed_at":"2026-08-13T00:52:37.781808Z","submitted_at":"2024-03-17T07:08:55Z","title":"Scaling Data Diversity for Fine-Tuning Language Models in Human Alignment","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.11124","snapshot_observed_at":"2026-08-12T19:14:37.048328Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.10914","last_updated":"2025-02-20T06:07:41Z","snapshot_observed_at":"2026-08-13T06:34:56.722164Z","submitted_at":"2024-11-16T23:53:27Z","title":"BPO: Towards Balanced Preference Optimization between Knowledge Breadth and Depth in Alignment","version":2},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-12T19:14:37.048328Z"},"links":{"cited_paper":"/paper/2403.11124","citing_paper":"/paper/2411.10914"},"observation_digest":"sha256:85a68a152d901453ed77777f65e38c4f331e069cccce78554fed1775f2bd3778","observation_id":"086b6d6e-edb9-4462-88db-ce08ad0f4fec","resolution":{"observed_at":"2026-08-12T19:14:37.048328Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.13446","last_updated":"2024-12-02T20:55:15Z","snapshot_observed_at":"2026-08-13T04:14:07.353644Z","submitted_at":"2024-02-21T00:44:04Z","title":"Large Language Models for Data Annotation and Synthesis: A Survey","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.13446","snapshot_observed_at":"2026-08-12T19:14:37.051944Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.10914","last_updated":"2025-02-20T06:07:41Z","snapshot_observed_at":"2026-08-13T06:34:56.722164Z","submitted_at":"2024-11-16T23:53:27Z","title":"BPO: Towards Balanced Preference Optimization between Knowledge Breadth and Depth in Alignment","version":2},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-12T19:14:37.051944Z"},"links":{"cited_paper":"/paper/2402.13446","citing_paper":"/paper/2411.10914"},"observation_digest":"sha256:4b73444dcee2d4e74c9a2da07768ff518b2ebdcc4377e11148e8e5d62ac4d9d4","observation_id":"42734856-6fdf-4619-a1cd-ca674320fcc5","resolution":{"observed_at":"2026-08-12T19:14:37.051944Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-12T19:14:37.055697Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.10914","last_updated":"2025-02-20T06:07:41Z","snapshot_observed_at":"2026-08-13T06:34:56.722164Z","submitted_at":"2024-11-16T23:53:27Z","title":"BPO: Towards Balanced Preference Optimization between Knowledge Breadth and Depth in Alignment","version":2},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-12T19:14:37.055697Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2411.10914"},"observation_digest":"sha256:8b343820c71c3f356e5b67b25c17bf28bf3bd1eb1de4b88489a450acf854fd0c","observation_id":"9151b43a-189e-41c4-95cc-b9cf93321c97","resolution":{"observed_at":"2026-08-12T19:14:37.055697Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.18248","last_updated":"2024-07-25T17:59:16Z","snapshot_observed_at":"2026-08-12T23:14:38.666642Z","submitted_at":"2024-07-25T17:59:16Z","title":"Self-Training with Direct Preference Optimization Improves Chain-of-Thought Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.18248","snapshot_observed_at":"2026-08-12T19:14:37.059688Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.10914","last_updated":"2025-02-20T06:07:41Z","snapshot_observed_at":"2026-08-13T06:34:56.722164Z","submitted_at":"2024-11-16T23:53:27Z","title":"BPO: Towards Balanced Preference Optimization between Knowledge Breadth and Depth in Alignment","version":2},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-12T19:14:37.059688Z"},"links":{"cited_paper":"/paper/2407.18248","citing_paper":"/paper/2411.10914"},"observation_digest":"sha256:9d4b03442924ea8071980e472dc65e623aa4b847834e4e7f94f61a65143523b4","observation_id":"600b09c2-b0cf-4a80-84ee-201ea6d4c4f8","resolution":{"observed_at":"2026-08-12T19:14:37.059688Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.12067","last_updated":"2026-04-12T14:13:44Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-23T11:27:30Z","title":"MM-LIMA: Less Is More for Alignment in Multi-Modal Datasets","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.12067","snapshot_observed_at":"2026-08-12T19:14:37.063986Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.10914","last_updated":"2025-02-20T06:07:41Z","snapshot_observed_at":"2026-08-13T06:34:56.722164Z","submitted_at":"2024-11-16T23:53:27Z","title":"BPO: Towards Balanced Preference Optimization between Knowledge Breadth and Depth in Alignment","version":2},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-12T19:14:37.063986Z"},"links":{"cited_paper":"/paper/2308.12067","citing_paper":"/paper/2411.10914"},"observation_digest":"sha256:c1524a500a8c575e6ab0b4bdeff3c8e4b5fd21777f57f1f0abe7774f365a3759","observation_id":"68d49670-edac-47e8-ae30-29b0204c216b","resolution":{"observed_at":"2026-08-12T19:14:37.063986Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.04333","last_updated":"2024-06-13T03:42:02Z","snapshot_observed_at":"2026-08-13T04:24:51.821062Z","submitted_at":"2024-02-06T19:18:04Z","title":"LESS: Selecting Influential Data for Targeted Instruction Tuning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.04333","snapshot_observed_at":"2026-08-12T19:14:37.068426Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.10914","last_updated":"2025-02-20T06:07:41Z","snapshot_observed_at":"2026-08-13T06:34:56.722164Z","submitted_at":"2024-11-16T23:53:27Z","title":"BPO: Towards Balanced Preference Optimization between Knowledge Breadth and Depth in Alignment","version":2},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-12T19:14:37.068426Z"},"links":{"cited_paper":"/paper/2402.04333","citing_paper":"/paper/2411.10914"},"observation_digest":"sha256:ae0ef5415746ec3dc79fa34ead9db60c0b8aead8687afeae3a598097ea6c05b8","observation_id":"7052df9d-d093-454c-86e8-712b6a15f902","resolution":{"observed_at":"2026-08-12T19:14:37.068426Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.03136","last_updated":"2025-08-20T03:44:04Z","snapshot_observed_at":"2026-08-12T22:31:04.156123Z","submitted_at":"2024-10-04T04:23:36Z","title":"Deliberate Reasoning in Language Models as Structure-Aware Planning with an Accurate World Model","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.03136","snapshot_observed_at":"2026-08-12T19:14:37.072615Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.10914","last_updated":"2025-02-20T06:07:41Z","snapshot_observed_at":"2026-08-13T06:34:56.722164Z","submitted_at":"2024-11-16T23:53:27Z","title":"BPO: Towards Balanced Preference Optimization between Knowledge Breadth and Depth in Alignment","version":2},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-12T19:14:37.072615Z"},"links":{"cited_paper":"/paper/2410.03136","citing_paper":"/paper/2411.10914"},"observation_digest":"sha256:00e8363a291cf6dcf8f97b55329d6fa868819a9c5b477d08f8669f8ef1e7bc37","observation_id":"caff5bb9-a58b-46fa-8c55-8b9cfcb40e0c","resolution":{"observed_at":"2026-08-12T19:14:37.072615Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.10306","last_updated":"2025-02-24T07:59:10Z","snapshot_observed_at":"2026-08-13T19:39:41.487267Z","submitted_at":"2024-04-16T06:27:39Z","title":"Balancing Speciality and Versatility: A Coarse to Fine Framework for Mitigating Catastrophic Forgetting in Large Language Models","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.10306","snapshot_observed_at":"2026-08-12T19:14:37.076717Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.10914","last_updated":"2025-02-20T06:07:41Z","snapshot_observed_at":"2026-08-13T06:34:56.722164Z","submitted_at":"2024-11-16T23:53:27Z","title":"BPO: Towards Balanced Preference Optimization between Knowledge Breadth and Depth in Alignment","version":2},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-12T19:14:37.076717Z"},"links":{"cited_paper":"/paper/2404.10306","citing_paper":"/paper/2411.10914"},"observation_digest":"sha256:a51c18324c985523f58eb5e950f471f5f468e3c3265c0fcb579b8dc80e6c4884","observation_id":"31669112-6165-4d6a-9289-87bc1809bbc9","resolution":{"observed_at":"2026-08-12T19:14:37.076717Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.10425","last_updated":"2023-05-17T17:57:10Z","snapshot_observed_at":"2026-08-13T11:40:02.795309Z","submitted_at":"2023-05-17T17:57:10Z","title":"SLiC-HF: Sequence Likelihood Calibration with Human Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.10425","snapshot_observed_at":"2026-08-12T19:14:37.080793Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.10914","last_updated":"2025-02-20T06:07:41Z","snapshot_observed_at":"2026-08-13T06:34:56.722164Z","submitted_at":"2024-11-16T23:53:27Z","title":"BPO: Towards Balanced Preference Optimization between Knowledge Breadth and Depth in Alignment","version":2},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-12T19:14:37.080793Z"},"links":{"cited_paper":"/paper/2305.10425","citing_paper":"/paper/2411.10914"},"observation_digest":"sha256:88ba56739fc0564c2523db52bcb67ab8408961986542ba1852d635ae33568569","observation_id":"309eb1cf-e393-4d62-bbec-c2ccdf9dabdf","resolution":{"observed_at":"2026-08-12T19:14:37.080793Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:14:37.084737Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.10914","last_updated":"2025-02-20T06:07:41Z","snapshot_observed_at":"2026-08-13T06:34:56.722164Z","submitted_at":"2024-11-16T23:53:27Z","title":"BPO: Towards Balanced Preference Optimization between Knowledge Breadth and Depth in Alignment","version":2},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-12T19:14:37.084737Z"},"links":{"citing_paper":"/paper/2411.10914"},"observation_digest":"sha256:9298848fe305fc9149f974a8b95b20ab818a130041b796306824657a1ea20b07","observation_id":"9956b1d7-86f8-4c61-8146-b2d4e0f16354","resolution":{"observed_at":"2026-08-12T19:14:37.084737Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.05696","last_updated":"2024-02-29T03:04:22Z","snapshot_observed_at":"2026-08-13T15:18:42.160030Z","submitted_at":"2023-08-10T16:58:51Z","title":"A Preliminary Study of the Intrinsic Relationship between Complexity and Alignment","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.05696","snapshot_observed_at":"2026-08-12T19:14:37.088657Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.10914","last_updated":"2025-02-20T06:07:41Z","snapshot_observed_at":"2026-08-13T06:34:56.722164Z","submitted_at":"2024-11-16T23:53:27Z","title":"BPO: Towards Balanced Preference Optimization between Knowledge Breadth and Depth in Alignment","version":2},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-12T19:14:37.088657Z"},"links":{"cited_paper":"/paper/2308.05696","citing_paper":"/paper/2411.10914"},"observation_digest":"sha256:72362d16429bf59805bbb89e90f550d21961b6290b35f671461783f3b1e820e7","observation_id":"de50be09-0fa0-4baa-b30c-f4b0c619a46a","resolution":{"observed_at":"2026-08-12T19:14:37.088657Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:14:37.092585Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.10914","last_updated":"2025-02-20T06:07:41Z","snapshot_observed_at":"2026-08-13T06:34:56.722164Z","submitted_at":"2024-11-16T23:53:27Z","title":"BPO: Towards Balanced Preference Optimization between Knowledge Breadth and Depth in Alignment","version":2},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-12T19:14:37.092585Z"},"links":{"citing_paper":"/paper/2411.10914"},"observation_digest":"sha256:e70d62eab52e0f16c0fefc46cb29c0ea8655daf6948b2499327ddfc218102058","observation_id":"afef957d-bbef-4f72-8fc9-050b3d87cb66","resolution":{"observed_at":"2026-08-12T19:14:37.092585Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.05685","last_updated":"2023-12-24T02:01:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-09T05:55:52Z","title":"Judging LLM-as-a-Judge with MT-Bench and Chatbot Arena","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.05685","snapshot_observed_at":"2026-08-12T19:14:37.096279Z","title":"Xing, Hao Zhang, Joseph E","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.10914","last_updated":"2025-02-20T06:07:41Z","snapshot_observed_at":"2026-08-13T06:34:56.722164Z","submitted_at":"2024-11-16T23:53:27Z","title":"BPO: Towards Balanced Preference Optimization between Knowledge Breadth and Depth in Alignment","version":2},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-12T19:14:37.096279Z"},"links":{"cited_paper":"/paper/2306.05685","citing_paper":"/paper/2411.10914"},"observation_digest":"sha256:2e020304175071cc3b4c2e3468da1e1ebb6fc485befcd9f8363adbb5d0d401d1","observation_id":"9aab5a24-06fb-42b2-8d4b-28dbd8fdceeb","resolution":{"observed_at":"2026-08-12T19:14:37.096279Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:14:37.100583Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.10914","last_updated":"2025-02-20T06:07:41Z","snapshot_observed_at":"2026-08-13T06:34:56.722164Z","submitted_at":"2024-11-16T23:53:27Z","title":"BPO: Towards Balanced Preference Optimization between Knowledge Breadth and Depth in Alignment","version":2},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-12T19:14:37.100583Z"},"links":{"citing_paper":"/paper/2411.10914"},"observation_digest":"sha256:f646238baa22fbf974bc5e11981870c41c7680dc495b207e683cc55ffe9693ac","observation_id":"4cf83a48-672c-44aa-802b-c3476bd48e78","resolution":{"observed_at":"2026-08-12T19:14:37.100583Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:14:37.537335Z","title":null,"venue":null,"work_id":"812eaf3b-88f0-4e5c-acb1-a48f4f3fdeda","year":2023},"citing_paper":{"arxiv_id":"2411.10914","last_updated":"2025-02-20T06:07:41Z","snapshot_observed_at":"2026-08-13T06:34:56.722164Z","submitted_at":"2024-11-16T23:53:27Z","title":"BPO: Towards Balanced Preference Optimization between Knowledge Breadth and Depth in Alignment","version":2},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-12T19:14:37.105579Z"},"links":{"citing_paper":"/paper/2411.10914"},"observation_digest":"sha256:3c428e4691fb55cc9b875b147cab66fbbb726ec6d30b453af5a6335d73bf0019","observation_id":"f1cca3cf-1002-453b-8444-bfbf03024b56","resolution":{"observed_at":"2026-08-12T19:14:37.542635Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.02231","last_updated":"2023-11-02T22:47:14Z","snapshot_observed_at":"2026-08-13T11:25:01.935241Z","submitted_at":"2023-06-04T01:59:40Z","title":"Fine-Tuning Language Models with Advantage-Induced Policy Alignment","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.02231","snapshot_observed_at":"2026-08-12T19:14:37.109155Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.10914","last_updated":"2025-02-20T06:07:41Z","snapshot_observed_at":"2026-08-13T06:34:56.722164Z","submitted_at":"2024-11-16T23:53:27Z","title":"BPO: Towards Balanced Preference Optimization between Knowledge Breadth and Depth in Alignment","version":2},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-12T19:14:37.109155Z"},"links":{"cited_paper":"/paper/2306.02231","citing_paper":"/paper/2411.10914"},"observation_digest":"sha256:187955e5f2a9538f6b0c15d6d1bd6bf91d25d68c90f3c3ce9ecaa978d1981947","observation_id":"58f29db0-07ed-4283-88e8-8a00c4d0fe53","resolution":{"observed_at":"2026-08-12T19:14:37.109155Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:14:37.113077Z","title":"online\" 'onlinestring :=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.10914","last_updated":"2025-02-20T06:07:41Z","snapshot_observed_at":"2026-08-13T06:34:56.722164Z","submitted_at":"2024-11-16T23:53:27Z","title":"BPO: Towards Balanced Preference Optimization between Knowledge Breadth and Depth in Alignment","version":2},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-12T19:14:37.113077Z"},"links":{"citing_paper":"/paper/2411.10914"},"observation_digest":"sha256:b0d1f8de2025b6ddff93c6f9088182222e06a5498c75a2bf0d9a7512d46e4786","observation_id":"70199fa9-37cd-4829-99cd-5b4eeb78834d","resolution":{"observed_at":"2026-08-12T19:14:37.113077Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:14:37.117468Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.10914","last_updated":"2025-02-20T06:07:41Z","snapshot_observed_at":"2026-08-13T06:34:56.722164Z","submitted_at":"2024-11-16T23:53:27Z","title":"BPO: Towards Balanced Preference Optimization between Knowledge Breadth and Depth in Alignment","version":2},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-12T19:14:37.117468Z"},"links":{"citing_paper":"/paper/2411.10914"},"observation_digest":"sha256:1e05f21611cf03fe141ce7d66d24e0224a5ec8220a86f24cd7cadfb778294ccb","observation_id":"92f1c020-bf53-45b2-8905-2631d69a296f","resolution":{"observed_at":"2026-08-12T19:14:37.117468Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2411.10914","last_updated":"2025-02-20T06:07:41Z","latest_version":2,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-13T06:34:56.722164Z","submitted_at":"2024-11-16T23:53:27Z","title":"BPO: Towards Balanced Preference Optimization between Knowledge Breadth and Depth in Alignment"},"reference_resolution":{"displayed":49,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":49,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":49},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"thesis":"As of 14 August 2026, this Paper Citation Record lists 49 of 49 outbound references and 2 inbound Pith citation observations for arXiv:2411.10914."}