{"as_of":"2026-08-10T02:18:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:45863ecdacccd8effa8755cbc629727464fc614defd960e23dc631e857ceb723","coverage":[{"denominator":35,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":35,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-08T18:10:53.458422Z","state":"measured"},{"denominator":35,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":35,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2502.05773/citation-record","integrity":"/paper/2502.05773/integrity","json":"/paper/2502.05773/citation-record.json","paper":"/paper/2502.05773"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2410.04166","last_updated":"2025-03-07T10:51:04Z","snapshot_observed_at":"2026-08-10T01:49:43.194696Z","submitted_at":"2024-10-05T14:04:03Z","title":"Learning from negative feedback, or positive feedback or both","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.04166","snapshot_observed_at":"2026-08-08T18:10:53.340865Z","title":"T., Hertweck, T., Joshi, R., Oh, J., Bloesch, M., Lampe, T., Heess, N., et al","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.05773","last_updated":"2025-07-24T22:59:42Z","snapshot_observed_at":"2026-08-10T01:49:25.494930Z","submitted_at":"2025-02-09T04:31:30Z","title":"PIPA: Preference Alignment as Prior-Informed Statistical Estimation","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-08T18:10:53.340865Z"},"links":{"cited_paper":"/paper/2410.04166","citing_paper":"/paper/2502.05773"},"observation_digest":"sha256:fb7dd896ec8f16905b7a9dea0ee4b55537c983201207b751ebb6d63404b649f4","observation_id":"a869fe09-2ea4-4a9f-a322-c1eff8008cb4","resolution":{"observed_at":"2026-08-08T18:10:53.340865Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.03553","last_updated":"2024-09-27T08:16:28Z","snapshot_observed_at":"2026-08-08T14:49:36.757543Z","submitted_at":"2024-05-06T15:20:30Z","title":"AlphaMath Almost Zero: Process Supervision without Process","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.03553","snapshot_observed_at":"2026-08-08T18:10:53.351858Z","title":"Alphamath almost zero: process supervision without process","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.05773","last_updated":"2025-07-24T22:59:42Z","snapshot_observed_at":"2026-08-10T01:49:25.494930Z","submitted_at":"2025-02-09T04:31:30Z","title":"PIPA: Preference Alignment as Prior-Informed Statistical Estimation","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-08T18:10:53.351858Z"},"links":{"cited_paper":"/paper/2405.03553","citing_paper":"/paper/2502.05773"},"observation_digest":"sha256:62994adb8b8d7ae235b73b5da369662a8132f8ce994ee8c3d6098f1505fbc991","observation_id":"db981569-bbae-4bbb-9a6c-4b523ed8decb","resolution":{"observed_at":"2026-08-08T18:10:53.351858Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-08T18:10:53.358850Z","title":"The llama 3 herd of models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.05773","last_updated":"2025-07-24T22:59:42Z","snapshot_observed_at":"2026-08-10T01:49:25.494930Z","submitted_at":"2025-02-09T04:31:30Z","title":"PIPA: Preference Alignment as Prior-Informed Statistical Estimation","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-08T18:10:53.358850Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2502.05773"},"observation_digest":"sha256:4bc3e99eeac35d700eff4e95c63b384abbae8e91194869d1efb0c5af116b8081","observation_id":"1c8db598-fd29-4a54-ac1d-4ffa02a74aa8","resolution":{"observed_at":"2026-08-08T18:10:53.358850Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.14115","last_updated":"2024-01-10T16:11:32Z","snapshot_observed_at":"2026-07-06T16:51:40.320710Z","submitted_at":"2023-11-23T17:20:36Z","title":"A density estimation perspective on learning from pairwise human preferences","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.14115","snapshot_observed_at":"2026-08-08T18:10:53.362923Z","title":"D., Castro, P","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.05773","last_updated":"2025-07-24T22:59:42Z","snapshot_observed_at":"2026-08-10T01:49:25.494930Z","submitted_at":"2025-02-09T04:31:30Z","title":"PIPA: Preference Alignment as Prior-Informed Statistical Estimation","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-08T18:10:53.362923Z"},"links":{"cited_paper":"/paper/2311.14115","citing_paper":"/paper/2502.05773"},"observation_digest":"sha256:98c4c3e45e718ebbc052e69b60108ec2612df9ec8789f3c0934003ef5681155a","observation_id":"bfb4e99f-bfdf-4464-8ff4-4f5022b07e01","resolution":{"observed_at":"2026-08-08T18:10:53.362923Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.01306","last_updated":"2024-11-19T18:12:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-02-02T10:53:36Z","title":"KTO: Model Alignment as Prospect Theoretic Optimization","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.01306","snapshot_observed_at":"2026-08-08T18:10:53.366395Z","title":"Kto: Model alignment as prospect theoretic optimization","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.05773","last_updated":"2025-07-24T22:59:42Z","snapshot_observed_at":"2026-08-10T01:49:25.494930Z","submitted_at":"2025-02-09T04:31:30Z","title":"PIPA: Preference Alignment as Prior-Informed Statistical Estimation","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-08T18:10:53.366395Z"},"links":{"cited_paper":"/paper/2402.01306","citing_paper":"/paper/2502.05773"},"observation_digest":"sha256:6e4a9bf7ebe4089ffd06e90daa88925de741fb08fb5977b06980acc040dbd59c","observation_id":"42ec5816-5684-40d8-8f3b-ddce6bd3e19d","resolution":{"observed_at":"2026-08-08T18:10:53.366395Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.17452","last_updated":"2024-02-21T12:59:22Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-29T17:59:38Z","title":"ToRA: A Tool-Integrated Reasoning Agent for Mathematical Problem Solving","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.17452","snapshot_observed_at":"2026-08-08T18:10:53.369715Z","title":"Tora: A tool-integrated reasoning agent for mathematical problem solving","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.05773","last_updated":"2025-07-24T22:59:42Z","snapshot_observed_at":"2026-08-10T01:49:25.494930Z","submitted_at":"2025-02-09T04:31:30Z","title":"PIPA: Preference Alignment as Prior-Informed Statistical Estimation","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-08T18:10:53.369715Z"},"links":{"cited_paper":"/paper/2309.17452","citing_paper":"/paper/2502.05773"},"observation_digest":"sha256:e4036d92c3b3001983d6bc9111d58aeaf2c23d8408a950eed69893113f1efb82","observation_id":"b1c35814-267b-4b9e-9abe-6ac178bfb733","resolution":{"observed_at":"2026-08-08T18:10:53.369715Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.04519","last_updated":"2025-01-08T14:12:57Z","snapshot_observed_at":"2026-08-04T20:57:22.329262Z","submitted_at":"2025-01-08T14:12:57Z","title":"rStar-Math: Small LLMs Can Master Math Reasoning with Self-Evolved Deep Thinking","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.04519","snapshot_observed_at":"2026-08-08T18:10:53.373963Z","title":"L., Liu, Y ., Shang, N., Sun, Y ., Zhu, Y ., Yang, F., and Yang, M","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.05773","last_updated":"2025-07-24T22:59:42Z","snapshot_observed_at":"2026-08-10T01:49:25.494930Z","submitted_at":"2025-02-09T04:31:30Z","title":"PIPA: Preference Alignment as Prior-Informed Statistical Estimation","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-08T18:10:53.373963Z"},"links":{"cited_paper":"/paper/2501.04519","citing_paper":"/paper/2502.05773"},"observation_digest":"sha256:8b0634e44263c42b2868b8a443939ec4e08bc726d41d50638dd15f54aee38fa6","observation_id":"bb67e40f-4cf7-42ae-8179-a6522be88ea6","resolution":{"observed_at":"2026-08-08T18:10:53.373963Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2103.03874","last_updated":"2021-11-08T21:30:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2021-03-05T18:59:39Z","title":"Measuring Mathematical Problem Solving With the MATH Dataset","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2103.03874","snapshot_observed_at":"2026-08-08T18:10:53.380575Z","title":"Measuring math- ematical problem solving with the math dataset","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.05773","last_updated":"2025-07-24T22:59:42Z","snapshot_observed_at":"2026-08-10T01:49:25.494930Z","submitted_at":"2025-02-09T04:31:30Z","title":"PIPA: Preference Alignment as Prior-Informed Statistical Estimation","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-08T18:10:53.380575Z"},"links":{"cited_paper":"/paper/2103.03874","citing_paper":"/paper/2502.05773"},"observation_digest":"sha256:6e7fffd4b8118ef7495981428bffb39d7c04a7e4aca18ab16c22d1405469dfb1","observation_id":"e0267fe8-794e-4583-8a94-005c3ab57fbd","resolution":{"observed_at":"2026-08-08T18:10:53.380575Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.09685","last_updated":"2021-10-16T18:40:34Z","snapshot_observed_at":"2026-08-07T07:43:16.294957Z","submitted_at":"2021-06-17T17:37:18Z","title":"LoRA: Low-Rank Adaptation of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.09685","snapshot_observed_at":"2026-08-08T18:10:53.384027Z","title":"J., Shen, Y ., Wallis, P., Allen-Zhu, Z., Li, Y ., Wang, S., Wang, L., and Chen, W","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.05773","last_updated":"2025-07-24T22:59:42Z","snapshot_observed_at":"2026-08-10T01:49:25.494930Z","submitted_at":"2025-02-09T04:31:30Z","title":"PIPA: Preference Alignment as Prior-Informed Statistical Estimation","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-08T18:10:53.384027Z"},"links":{"cited_paper":"/paper/2106.09685","citing_paper":"/paper/2502.05773"},"observation_digest":"sha256:76c4db55f1c9024ff1d0084a568051181cf39a60f8f930402279db1a2657b897","observation_id":"ae9d5c95-2e19-4a76-95f1-22213100fe36","resolution":{"observed_at":"2026-08-08T18:10:53.384027Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.11143","last_updated":"2025-10-09T12:22:46Z","snapshot_observed_at":"2026-07-31T12:28:37.704994Z","submitted_at":"2024-05-20T01:04:40Z","title":"OpenRLHF: An Easy-to-use, Scalable and High-performance RLHF Framework","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.11143","snapshot_observed_at":"2026-08-08T18:10:53.386861Z","title":"Openrlhf: An easy-to-use, scalable and high-performance rlhf framework","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.05773","last_updated":"2025-07-24T22:59:42Z","snapshot_observed_at":"2026-08-10T01:49:25.494930Z","submitted_at":"2025-02-09T04:31:30Z","title":"PIPA: Preference Alignment as Prior-Informed Statistical Estimation","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-08T18:10:53.386861Z"},"links":{"cited_paper":"/paper/2405.11143","citing_paper":"/paper/2502.05773"},"observation_digest":"sha256:8306b9491456465ddfebcc9b6d4bfdaf8e298b355692afe035ac217bd4ccab11","observation_id":"cbbde740-5f70-4ffc-9d45-157e1e11084d","resolution":{"observed_at":"2026-08-08T18:10:53.386861Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2012.11635","last_updated":"2021-05-06T10:18:59Z","snapshot_observed_at":"2026-08-09T09:04:20.589971Z","submitted_at":"2020-12-21T19:02:41Z","title":"A Distributional Approach to Controlled Text Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2012.11635","snapshot_observed_at":"2026-08-08T18:10:53.390096Z","title":"A distri- butional approach to controlled text generation","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2502.05773","last_updated":"2025-07-24T22:59:42Z","snapshot_observed_at":"2026-08-10T01:49:25.494930Z","submitted_at":"2025-02-09T04:31:30Z","title":"PIPA: Preference Alignment as Prior-Informed Statistical Estimation","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-08T18:10:53.390096Z"},"links":{"cited_paper":"/paper/2012.11635","citing_paper":"/paper/2502.05773"},"observation_digest":"sha256:88663de1ce9ac72ce92111d4a617334e173f76216c9f408863859950afd8c109","observation_id":"184611e2-ca00-49f0-9320-c3fe399d533d","resolution":{"observed_at":"2026-08-08T18:10:53.390096Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.20050","last_updated":"2023-05-31T17:24:00Z","snapshot_observed_at":"2026-08-05T13:11:04.104454Z","submitted_at":"2023-05-31T17:24:00Z","title":"Let's Verify Step by Step","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.20050","snapshot_observed_at":"2026-08-08T18:10:53.396690Z","title":"Let’s verify step by step","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.05773","last_updated":"2025-07-24T22:59:42Z","snapshot_observed_at":"2026-08-10T01:49:25.494930Z","submitted_at":"2025-02-09T04:31:30Z","title":"PIPA: Preference Alignment as Prior-Informed Statistical Estimation","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-08T18:10:53.396690Z"},"links":{"cited_paper":"/paper/2305.20050","citing_paper":"/paper/2502.05773"},"observation_digest":"sha256:225e2f53f4f9b1a185cbc7c3ec8c9f7ad5ec3111fe45602912cab9898f7aeb32","observation_id":"c620067a-5469-4982-bbf5-665206007a51","resolution":{"observed_at":"2026-08-08T18:10:53.396690Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.10799","last_updated":"2025-01-18T15:38:03Z","snapshot_observed_at":"2026-08-09T13:54:08.110394Z","submitted_at":"2025-01-18T15:38:03Z","title":"Step-KTO: Optimizing Mathematical Reasoning through Stepwise Binary Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.10799","snapshot_observed_at":"2026-08-08T18:10:53.399807Z","title":"Step-kto: Optimizing mathematical reasoning through stepwise bi- nary feedback","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.05773","last_updated":"2025-07-24T22:59:42Z","snapshot_observed_at":"2026-08-10T01:49:25.494930Z","submitted_at":"2025-02-09T04:31:30Z","title":"PIPA: Preference Alignment as Prior-Informed Statistical Estimation","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-08T18:10:53.399807Z"},"links":{"cited_paper":"/paper/2501.10799","citing_paper":"/paper/2502.05773"},"observation_digest":"sha256:8e89582da733568827649ca96f084c23d54e53a3234adef71f5c88790ae2ca52","observation_id":"633c2580-ae6d-44b5-8df8-b43e7dba58a0","resolution":{"observed_at":"2026-08-08T18:10:53.399807Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.04350","last_updated":"2025-04-15T03:59:54Z","snapshot_observed_at":"2026-08-01T14:48:09.844175Z","submitted_at":"2024-10-06T04:03:00Z","title":"TIS-DPO: Token-level Importance Sampling for Direct Preference Optimization With Estimated Weights","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.04350","snapshot_observed_at":"2026-08-08T18:10:53.403293Z","title":"M., Liu, X., Wen, L., et al","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.05773","last_updated":"2025-07-24T22:59:42Z","snapshot_observed_at":"2026-08-10T01:49:25.494930Z","submitted_at":"2025-02-09T04:31:30Z","title":"PIPA: Preference Alignment as Prior-Informed Statistical Estimation","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-08T18:10:53.403293Z"},"links":{"cited_paper":"/paper/2410.04350","citing_paper":"/paper/2502.05773"},"observation_digest":"sha256:e87a4f7c4401146dbc938f2beb90f179e197a29d8e8a698b318f508f0fb1d656","observation_id":"fb198fad-5d20-4ba4-8b02-351a13ba207f","resolution":{"observed_at":"2026-08-08T18:10:53.403293Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.14734","last_updated":"2024-11-01T20:05:19Z","snapshot_observed_at":"2026-08-03T02:02:15.325394Z","submitted_at":"2024-05-23T16:01:46Z","title":"SimPO: Simple Preference Optimization with a Reference-Free Reward","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.14734","snapshot_observed_at":"2026-08-08T18:10:53.406513Z","title":"Simpo: Simple preference optimization with a reference-free reward","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.05773","last_updated":"2025-07-24T22:59:42Z","snapshot_observed_at":"2026-08-10T01:49:25.494930Z","submitted_at":"2025-02-09T04:31:30Z","title":"PIPA: Preference Alignment as Prior-Informed Statistical Estimation","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-08T18:10:53.406513Z"},"links":{"cited_paper":"/paper/2405.14734","citing_paper":"/paper/2502.05773"},"observation_digest":"sha256:8b01046fc126529e44e08ab6f78a036a102551ee86f28fd53619bd61aa158d94","observation_id":"01f88fa3-c77b-44a4-9d1a-f45e326b74e3","resolution":{"observed_at":"2026-08-08T18:10:53.406513Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.02479","last_updated":"2024-06-10T10:18:46Z","snapshot_observed_at":"2026-07-06T17:25:05.974815Z","submitted_at":"2024-02-04T13:16:29Z","title":"BRAIn: Bayesian Reward-conditioned Amortized Inference for natural language generation from feedback","version":2},"cited_work":{"arxiv_id":"2402.02479","doi":null,"metadata_source":"pith","pith_arxiv_id":"2402.02479","snapshot_observed_at":"2026-08-08T18:10:53.591723Z","title":"BRAIn: Bayesian Reward-conditioned Amortized Inference for natural language generation from feedback","venue":"cs.LG","work_id":"aec86bf9-c270-4e0a-a3ad-d1b19f657861","year":2024},"citing_paper":{"arxiv_id":"2502.05773","last_updated":"2025-07-24T22:59:42Z","snapshot_observed_at":"2026-08-10T01:49:25.494930Z","submitted_at":"2025-02-09T04:31:30Z","title":"PIPA: Preference Alignment as Prior-Informed Statistical Estimation","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-08T18:10:53.409932Z"},"links":{"cited_paper":"/paper/2402.02479","citing_paper":"/paper/2502.05773"},"observation_digest":"sha256:38d8bab1f66e88f200bd6727f720d81c105b6025fc80987cd1e5f9d6069c9674","observation_id":"52924448-f3bd-467e-863b-c2a89593b9da","resolution":{"observed_at":"2026-08-08T18:10:53.595190Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.19733","last_updated":"2024-06-26T01:28:35Z","snapshot_observed_at":"2026-08-06T12:20:08.657659Z","submitted_at":"2024-04-30T17:28:05Z","title":"Iterative Reasoning Preference Optimization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.19733","snapshot_observed_at":"2026-08-08T18:10:53.414173Z","title":"Y ., Yuan, W., Cho, K., He, H., Sukhbaatar, S., and Weston, J","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.05773","last_updated":"2025-07-24T22:59:42Z","snapshot_observed_at":"2026-08-10T01:49:25.494930Z","submitted_at":"2025-02-09T04:31:30Z","title":"PIPA: Preference Alignment as Prior-Informed Statistical Estimation","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-08T18:10:53.414173Z"},"links":{"cited_paper":"/paper/2404.19733","citing_paper":"/paper/2502.05773"},"observation_digest":"sha256:141d58d93bb3d53eafaf67d81aef65bb8984510fd02b587730ec0da18bad47f0","observation_id":"9b4352dd-93a6-40ec-bb58-8b885156257f","resolution":{"observed_at":"2026-08-08T18:10:53.414173Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1912.08517","last_updated":"2019-12-18T11:05:27Z","snapshot_observed_at":"2026-08-04T02:59:02.318368Z","submitted_at":"2019-12-18T11:05:27Z","title":"Distributional Reinforcement Learning for Energy-Based Sequential Models","version":1},"cited_work":{"arxiv_id":"1912.08517","doi":null,"metadata_source":"pith","pith_arxiv_id":"1912.08517","snapshot_observed_at":"2026-08-08T18:10:53.568502Z","title":"Distributional Reinforcement Learning for Energy-Based Sequential Models","venue":"cs.LG","work_id":"743ba0f9-13d3-43c1-a123-0279ce93825e","year":2019},"citing_paper":{"arxiv_id":"2502.05773","last_updated":"2025-07-24T22:59:42Z","snapshot_observed_at":"2026-08-10T01:49:25.494930Z","submitted_at":"2025-02-09T04:31:30Z","title":"PIPA: Preference Alignment as Prior-Informed Statistical Estimation","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-08T18:10:53.417248Z"},"links":{"cited_paper":"/paper/1912.08517","citing_paper":"/paper/2502.05773"},"observation_digest":"sha256:65046c09dd958b2dfba0cc85488a14ea450da322679c457c00f1937e21af3975","observation_id":"3c873275-e653-42f2-a8b7-2bd1fb2da73f","resolution":{"observed_at":"2026-08-08T18:10:53.574432Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.08847","last_updated":"2025-04-27T15:21:29Z","snapshot_observed_at":"2026-07-06T19:31:49.052556Z","submitted_at":"2024-10-11T14:22:44Z","title":"Unintentional Unalignment: Likelihood Displacement in Direct Preference Optimization","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.08847","snapshot_observed_at":"2026-08-08T18:10:53.423975Z","title":"Unintentional unalignment: Likelihood displacement in direct preference optimization","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.05773","last_updated":"2025-07-24T22:59:42Z","snapshot_observed_at":"2026-08-10T01:49:25.494930Z","submitted_at":"2025-02-09T04:31:30Z","title":"PIPA: Preference Alignment as Prior-Informed Statistical Estimation","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-08T18:10:53.423975Z"},"links":{"cited_paper":"/paper/2410.08847","citing_paper":"/paper/2502.05773"},"observation_digest":"sha256:40f2bad9d725ab3121f2d08c5bdca6550d4e8d09891e1b0f0f244865021b5dfb","observation_id":"6ca434a0-5e97-4251-bae6-9b0c3d111987","resolution":{"observed_at":"2026-08-08T18:10:53.423975Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-08T18:10:53.426779Z","title":"Proximal policy optimization algorithms","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.05773","last_updated":"2025-07-24T22:59:42Z","snapshot_observed_at":"2026-08-10T01:49:25.494930Z","submitted_at":"2025-02-09T04:31:30Z","title":"PIPA: Preference Alignment as Prior-Informed Statistical Estimation","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-08T18:10:53.426779Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2502.05773"},"observation_digest":"sha256:bada3c55786bb31b2ce2a54e2cee06fe92038b5919cc238a28af3fd85f2d5b3d","observation_id":"99303e61-f71a-423f-bb96-2215a3635f4d","resolution":{"observed_at":"2026-08-08T18:10:53.426779Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.05749","last_updated":"2024-05-28T23:25:15Z","snapshot_observed_at":"2026-07-06T17:27:29.050237Z","submitted_at":"2024-02-08T15:33:09Z","title":"Generalized Preference Optimization: A Unified Approach to Offline Alignment","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.05749","snapshot_observed_at":"2026-08-08T18:10:53.433659Z","title":"D., Zheng, Z., Calandriello, D., Munos, R., Rowland, M., Richemond, P","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.05773","last_updated":"2025-07-24T22:59:42Z","snapshot_observed_at":"2026-08-10T01:49:25.494930Z","submitted_at":"2025-02-09T04:31:30Z","title":"PIPA: Preference Alignment as Prior-Informed Statistical Estimation","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-08T18:10:53.433659Z"},"links":{"cited_paper":"/paper/2402.05749","citing_paper":"/paper/2502.05773"},"observation_digest":"sha256:ee5722b35ef25b6074d1d6e84ea35f2806d070da88fa160062ed95f8f308c5ec","observation_id":"38788a5f-748a-40cb-8c14-7866e2068cf4","resolution":{"observed_at":"2026-08-08T18:10:53.433659Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16145","last_updated":"2024-12-25T18:54:02Z","snapshot_observed_at":"2026-07-06T20:11:06.248415Z","submitted_at":"2024-12-20T18:49:45Z","title":"Offline Reinforcement Learning for LLM Multi-Step Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.16145","snapshot_observed_at":"2026-08-08T18:10:53.436669Z","title":"Offline reinforcement learning for llm multi-step reasoning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.05773","last_updated":"2025-07-24T22:59:42Z","snapshot_observed_at":"2026-08-10T01:49:25.494930Z","submitted_at":"2025-02-09T04:31:30Z","title":"PIPA: Preference Alignment as Prior-Informed Statistical Estimation","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-08T18:10:53.436669Z"},"links":{"cited_paper":"/paper/2412.16145","citing_paper":"/paper/2502.05773"},"observation_digest":"sha256:1b4a2c18c0f6e52ba6e6ffb509006d67a6999326f44139bccdfd9784c10aebfe","observation_id":"3b599f16-a305-4fc8-9721-66e3ce66ec3c","resolution":{"observed_at":"2026-08-08T18:10:53.436669Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12122","last_updated":"2024-09-18T16:45:37Z","snapshot_observed_at":"2026-07-06T19:17:41.512834Z","submitted_at":"2024-09-18T16:45:37Z","title":"Qwen2.5-Math Technical Report: Toward Mathematical Expert Model via Self-Improvement","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12122","snapshot_observed_at":"2026-08-08T18:10:53.439730Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.05773","last_updated":"2025-07-24T22:59:42Z","snapshot_observed_at":"2026-08-10T01:49:25.494930Z","submitted_at":"2025-02-09T04:31:30Z","title":"PIPA: Preference Alignment as Prior-Informed Statistical Estimation","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-08T18:10:53.439730Z"},"links":{"cited_paper":"/paper/2409.12122","citing_paper":"/paper/2502.05773"},"observation_digest":"sha256:049cd44649c621bd29ba1948493fed56487f2d5fd88276a80f0c47e5255687fd","observation_id":"4169deec-8b4d-4d56-b262-25b42c7f9643","resolution":{"observed_at":"2026-08-08T18:10:53.439730Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.11999","last_updated":"2024-08-30T03:39:57Z","snapshot_observed_at":"2026-07-06T18:02:02.384288Z","submitted_at":"2024-04-18T08:49:38Z","title":"Token-level Direct Preference Optimization","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.11999","snapshot_observed_at":"2026-08-08T18:10:53.442993Z","title":"Token-level direct preference optimization","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.05773","last_updated":"2025-07-24T22:59:42Z","snapshot_observed_at":"2026-08-10T01:49:25.494930Z","submitted_at":"2025-02-09T04:31:30Z","title":"PIPA: Preference Alignment as Prior-Informed Statistical Estimation","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-08T18:10:53.442993Z"},"links":{"cited_paper":"/paper/2404.11999","citing_paper":"/paper/2502.05773"},"observation_digest":"sha256:68b3ed4554cfe1f3741417b3f45b4711dbe9e2259cc939629312a23ea7d51225","observation_id":"404700b7-9a2b-4d46-9a65-bf8dc02287f0","resolution":{"observed_at":"2026-08-08T18:10:53.442993Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.03816","last_updated":"2024-11-18T05:36:16Z","snapshot_observed_at":"2026-08-04T20:04:21.125115Z","submitted_at":"2024-06-06T07:40:00Z","title":"ReST-MCTS*: LLM Self-Training via Process Reward Guided Tree Search","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.03816","snapshot_observed_at":"2026-08-08T18:10:53.446974Z","title":"Mario eval: Evaluate your math llm with your math llm–a mathematical dataset evaluation toolkit, 2024a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.05773","last_updated":"2025-07-24T22:59:42Z","snapshot_observed_at":"2026-08-10T01:49:25.494930Z","submitted_at":"2025-02-09T04:31:30Z","title":"PIPA: Preference Alignment as Prior-Informed Statistical Estimation","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-08T18:10:53.446974Z"},"links":{"cited_paper":"/paper/2406.03816","citing_paper":"/paper/2502.05773"},"observation_digest":"sha256:c02728ccca468c7f2b0b72b31a4f4f883eb2f1339fa7fbacaf155efede8d1006","observation_id":"2c915cf3-30ac-4f5a-a29b-5b1223555aed","resolution":{"observed_at":"2026-08-08T18:10:53.446974Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.18922","last_updated":"2025-05-21T15:34:02Z","snapshot_observed_at":"2026-07-31T18:34:20.947967Z","submitted_at":"2024-04-29T17:58:30Z","title":"DPO Meets PPO: Reinforced Token Optimization for RLHF","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.18922","snapshot_observed_at":"2026-08-08T18:10:53.450848Z","title":"Dpo meets ppo: Reinforced token optimization for rlhf","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.05773","last_updated":"2025-07-24T22:59:42Z","snapshot_observed_at":"2026-08-10T01:49:25.494930Z","submitted_at":"2025-02-09T04:31:30Z","title":"PIPA: Preference Alignment as Prior-Informed Statistical Estimation","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-08T18:10:53.450848Z"},"links":{"cited_paper":"/paper/2404.18922","citing_paper":"/paper/2502.05773"},"observation_digest":"sha256:30ccf141c8d43f644d3857ee2bfb8072f41a842c3614645a6ddc83111fb45d08","observation_id":"0247b814-5dab-4ed2-8f03-997e2df12d94","resolution":{"observed_at":"2026-08-08T18:10:53.450848Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11931","last_updated":"2024-06-17T13:51:35Z","snapshot_observed_at":"2026-08-07T06:30:25.302107Z","submitted_at":"2024-06-17T13:51:35Z","title":"DeepSeek-Coder-V2: Breaking the Barrier of Closed-Source Models in Code Intelligence","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.11931","snapshot_observed_at":"2026-08-08T18:10:53.454224Z","title":"Deepseek-coder- v2: Breaking the barrier of closed-source models in code intelligence","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.05773","last_updated":"2025-07-24T22:59:42Z","snapshot_observed_at":"2026-08-10T01:49:25.494930Z","submitted_at":"2025-02-09T04:31:30Z","title":"PIPA: Preference Alignment as Prior-Informed Statistical Estimation","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-08T18:10:53.454224Z"},"links":{"cited_paper":"/paper/2406.11931","citing_paper":"/paper/2502.05773"},"observation_digest":"sha256:8c1bc0f5016bf9c470652a4a445a95fdd348d27a12884f2794be1fbce18bc26c","observation_id":"9c916166-c222-4c93-a4fe-a1c463add787","resolution":{"observed_at":"2026-08-08T18:10:53.454224Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T18:10:53.849579Z","title":"Treating the sequences as a whole, the original DPO loss is given by LDPO(x, y+, y−, c+, c−) =− log σ X t rt(x, y+) − X t rt(x, y−) !","venue":null,"work_id":"88d1a009-52cb-45e7-94dd-e0698ac58aca","year":2025},"citing_paper":{"arxiv_id":"2502.05773","last_updated":"2025-07-24T22:59:42Z","snapshot_observed_at":"2026-08-10T01:49:25.494930Z","submitted_at":"2025-02-09T04:31:30Z","title":"PIPA: Preference Alignment as Prior-Informed Statistical Estimation","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-08T18:10:53.458422Z"},"links":{"citing_paper":"/paper/2502.05773"},"observation_digest":"sha256:44ecdb8416a831c17e162415cf924dc66b87fa48a45e7906196b42dcd290e641","observation_id":"50182318-2c61-450f-9ba8-3b7aaa1fd591","resolution":{"observed_at":"2026-08-08T18:10:53.853162Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-08T18:10:53.430637Z","title":"Deepseekmath: Push- ing the limits of mathematical reasoning in open language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.05773","last_updated":"2025-07-24T22:59:42Z","snapshot_observed_at":"2026-08-10T01:49:25.494930Z","submitted_at":"2025-02-09T04:31:30Z","title":"PIPA: Preference Alignment as Prior-Informed Statistical Estimation","version":2},"reference_index":2017,"source":"pdf_text","source_observed_at":"2026-08-08T18:10:53.430637Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2502.05773"},"observation_digest":"sha256:00e425ef37a25c12fc396ed6f73cf1781257daa20710ada48fd2399af17c90b7","observation_id":"7d34b587-4f78-4d23-ab71-4222eaa0414b","resolution":{"observed_at":"2026-08-08T18:10:53.430637Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12326","last_updated":"2025-01-21T17:48:10Z","snapshot_observed_at":"2026-07-06T20:23:58.426780Z","submitted_at":"2025-01-21T17:48:10Z","title":"UI-TARS: Pioneering Automated GUI Interaction with Native Agents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12326","snapshot_observed_at":"2026-08-08T18:10:53.420778Z","title":"Ui-tars: Pioneer- ing automated gui interaction with native agents","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.05773","last_updated":"2025-07-24T22:59:42Z","snapshot_observed_at":"2026-08-10T01:49:25.494930Z","submitted_at":"2025-02-09T04:31:30Z","title":"PIPA: Preference Alignment as Prior-Informed Statistical Estimation","version":2},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-08-08T18:10:53.420778Z"},"links":{"cited_paper":"/paper/2501.12326","citing_paper":"/paper/2502.05773"},"observation_digest":"sha256:2d0fc912ea6bdb277edbf28f8f31b8d670bbe9bdaa2fcce73ce93b8a3b93e21f","observation_id":"fa0fa2ab-c8a0-4e6d-b5be-63ace50658b6","resolution":{"observed_at":"2026-08-08T18:10:53.420778Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.07863","last_updated":"2024-11-12T11:18:43Z","snapshot_observed_at":"2026-08-07T08:32:00.916309Z","submitted_at":"2024-05-13T15:50:39Z","title":"RLHF Workflow: From Reward Modeling to Online RLHF","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.07863","snapshot_observed_at":"2026-08-08T18:10:53.355108Z","title":"Rlhf workflow: From reward modeling to online rlhf","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.05773","last_updated":"2025-07-24T22:59:42Z","snapshot_observed_at":"2026-08-10T01:49:25.494930Z","submitted_at":"2025-02-09T04:31:30Z","title":"PIPA: Preference Alignment as Prior-Informed Statistical Estimation","version":2},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-08T18:10:53.355108Z"},"links":{"cited_paper":"/paper/2405.07863","citing_paper":"/paper/2502.05773"},"observation_digest":"sha256:124b15a8ff717e1a06b3788b45c1e88601c3398d0b21a337a475b5b68d9bd5c6","observation_id":"9192cd6e-6866-4b1a-8956-9477bd06f053","resolution":{"observed_at":"2026-08-08T18:10:53.355108Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.18629","last_updated":"2024-06-26T17:43:06Z","snapshot_observed_at":"2026-08-06T00:24:52.274888Z","submitted_at":"2024-06-26T17:43:06Z","title":"Step-DPO: Step-wise Preference Optimization for Long-chain Reasoning of LLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.18629","snapshot_observed_at":"2026-08-08T18:10:53.393381Z","title":"Step-dpo: Step-wise preference optimiza- tion for long-chain reasoning of llms","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.05773","last_updated":"2025-07-24T22:59:42Z","snapshot_observed_at":"2026-08-10T01:49:25.494930Z","submitted_at":"2025-02-09T04:31:30Z","title":"PIPA: Preference Alignment as Prior-Informed Statistical Estimation","version":2},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-08T18:10:53.393381Z"},"links":{"cited_paper":"/paper/2406.18629","citing_paper":"/paper/2502.05773"},"observation_digest":"sha256:999bd9f821407341d15f239f6b69df4fa0c1c68fdaebfe8649d0c79a2953266c","observation_id":"4f4307c2-cea9-4983-a12e-5a00a1d79f35","resolution":{"observed_at":"2026-08-08T18:10:53.393381Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.14740","last_updated":"2024-02-26T18:26:25Z","snapshot_observed_at":"2026-08-09T14:30:33.899591Z","submitted_at":"2024-02-22T17:52:34Z","title":"Back to Basics: Revisiting REINFORCE Style Optimization for Learning from Human Feedback in LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.14740","snapshot_observed_at":"2026-08-08T18:10:53.348818Z","title":"Back to basics: Revisiting reinforce style optimization for 9 Prior-Informed Preference Alignment learning from human feedback in llms","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.05773","last_updated":"2025-07-24T22:59:42Z","snapshot_observed_at":"2026-08-10T01:49:25.494930Z","submitted_at":"2025-02-09T04:31:30Z","title":"PIPA: Preference Alignment as Prior-Informed Statistical Estimation","version":2},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-08T18:10:53.348818Z"},"links":{"cited_paper":"/paper/2402.14740","citing_paper":"/paper/2502.05773"},"observation_digest":"sha256:b4915cb146cfdc5fc9b1510d419c7f2a0fb12ca24caab64481a4cdd34986276d","observation_id":"bb563930-792b-4ab2-b5c8-1eef0d77164f","resolution":{"observed_at":"2026-08-08T18:10:53.348818Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-08T18:10:53.345556Z","title":"L., Almeida, D., Altenschmidt, J., Altman, S., Anadkat, S., et al","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.05773","last_updated":"2025-07-24T22:59:42Z","snapshot_observed_at":"2026-08-10T01:49:25.494930Z","submitted_at":"2025-02-09T04:31:30Z","title":"PIPA: Preference Alignment as Prior-Informed Statistical Estimation","version":2},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-08T18:10:53.345556Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2502.05773"},"observation_digest":"sha256:e6926832fabae373ed191de57c9fa586efea2a6f790a32d4cf6a1383800e0226","observation_id":"1d47ed88-ee14-4d31-a401-0e3114e2f2d0","resolution":{"observed_at":"2026-08-08T18:10:53.345556Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-08T18:10:53.377526Z","title":"Deepseek-r1: In- centivizing reasoning capability in llms via reinforcement learning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.05773","last_updated":"2025-07-24T22:59:42Z","snapshot_observed_at":"2026-08-10T01:49:25.494930Z","submitted_at":"2025-02-09T04:31:30Z","title":"PIPA: Preference Alignment as Prior-Informed Statistical Estimation","version":2},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-08T18:10:53.377526Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2502.05773"},"observation_digest":"sha256:c7c14c584bc11771601e1a2b706f83423edc8f290b249aa31a69b307cb294325","observation_id":"b5eb9dc4-4f7a-4afb-96da-16520c492d9f","resolution":{"observed_at":"2026-08-08T18:10:53.377526Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2502.05773","last_updated":"2025-07-24T22:59:42Z","latest_version":2,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-10T01:49:25.494930Z","submitted_at":"2025-02-09T04:31:30Z","title":"PIPA: Preference Alignment as Prior-Informed Statistical Estimation"},"reference_resolution":{"displayed":35,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":32,"verified_exact":2,"verified_fuzzy":1},"total_outbound_references":35},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 35 of 35 outbound references and 0 inbound Pith citation observations for arXiv:2502.05773."}