{"as_of":"2026-08-18T13:27:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:c04c59efed563419b69fa8a2a2fd9742929756cc963e875cb9565b5adb7b7732","coverage":[{"denominator":51,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":51,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T20:31:01.415106Z","state":"measured"},{"denominator":55,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":55,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-18T06:34:40.430872+00:00","state":"measured"},{"denominator":4,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":4,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-01T07:28:18.050097Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-06-29T12:23:24.212503Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.12843","last_updated":"2026-06-24T10:53:03Z","snapshot_observed_at":"2026-08-18T02:49:45.535530Z","submitted_at":"2025-05-19T08:29:28Z","title":"Bias Fitting to Mitigate Length Bias of Reward Model in RLHF","version":2},"cited_work":{"arxiv_id":"2505.12843","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.12843","snapshot_observed_at":"2026-06-29T12:23:24.212503Z","title":"Bias fitting to mitigate length bias of reward model in rlhf","venue":"cs.LG","work_id":"435933ea-3114-407b-bbdc-49f3ae963b96","year":2025},"citing_paper":{"arxiv_id":"2604.13602","last_updated":"2026-04-15T08:11:34Z","snapshot_observed_at":"2026-08-18T06:14:17.992551Z","submitted_at":"2026-04-15T08:11:34Z","title":"Reward Hacking in the Era of Large Models: Mechanisms, Emergent Misalignment, Challenges","version":1},"reference_index":130,"source":"pdf_text","source_observed_at":"2026-05-10T13:58:53.430492Z"},"links":{"cited_paper":"/paper/2505.12843","citing_paper":"/paper/2604.13602"},"observation_digest":"sha256:6249c3acecc52445febe1262ba2c1729d6b6d9328d3bbbeadc35cc6944e9c8f7","observation_id":"83119876-bf91-4161-9c30-bee51499f1ec","resolution":{"observed_at":"2026-06-25T02:17:29.855075Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.12843","last_updated":"2026-06-24T10:53:03Z","snapshot_observed_at":"2026-08-18T02:49:45.535530Z","submitted_at":"2025-05-19T08:29:28Z","title":"Bias Fitting to Mitigate Length Bias of Reward Model in RLHF","version":2},"cited_work":{"arxiv_id":"2505.12843","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.12843","snapshot_observed_at":"2026-06-29T12:23:24.212503Z","title":"Bias fitting to mitigate length bias of reward model in rlhf","venue":"cs.LG","work_id":"435933ea-3114-407b-bbdc-49f3ae963b96","year":2025},"citing_paper":{"arxiv_id":"2604.17328","last_updated":"2026-05-23T14:02:35Z","snapshot_observed_at":"2026-08-14T18:17:14.681691Z","submitted_at":"2026-04-19T08:48:46Z","title":"Rethinking the Comparison Unit in Sequence-Level Reinforcement Learning: An Equal-Length Paired Training Framework from Loss Correction to Sample Construction","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-05-10T06:23:14.905706Z"},"links":{"cited_paper":"/paper/2505.12843","citing_paper":"/paper/2604.17328"},"observation_digest":"sha256:eaca9e68b4a2e0e15e4d2f3459e97a5f1a9eae77a17f11c42f548e74639b038f","observation_id":"01dc5012-628e-4f96-8630-5ab77989de2c","resolution":{"observed_at":"2026-06-25T02:17:29.855075Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.12843","last_updated":"2026-06-24T10:53:03Z","snapshot_observed_at":"2026-08-18T02:49:45.535530Z","submitted_at":"2025-05-19T08:29:28Z","title":"Bias Fitting to Mitigate Length Bias of Reward Model in RLHF","version":2},"cited_work":{"arxiv_id":"2505.12843","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.12843","snapshot_observed_at":"2026-06-29T12:23:24.212503Z","title":"Bias fitting to mitigate length bias of reward model in rlhf","venue":"cs.LG","work_id":"435933ea-3114-407b-bbdc-49f3ae963b96","year":2025},"citing_paper":{"arxiv_id":"2605.27996","last_updated":"2026-05-29T02:24:56Z","snapshot_observed_at":"2026-07-06T23:37:36.244456Z","submitted_at":"2026-05-27T05:40:22Z","title":"Reward Bias Substitution: Single-Axis Bias Mitigations Redirect Optimization Pressure","version":2},"reference_index":96,"source":"arxiv_source","source_observed_at":"2026-06-29T12:22:06.635622Z"},"links":{"cited_paper":"/paper/2505.12843","citing_paper":"/paper/2605.27996"},"observation_digest":"sha256:e3fcc59a1e621db58160a84a8733acf9d0335ea72c39934ba6b08e389871964c","observation_id":"a1c70b58-51db-4535-98ad-f9d2cd75863d","resolution":{"observed_at":"2026-06-29T12:23:24.213633Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.12843","last_updated":"2026-06-24T10:53:03Z","snapshot_observed_at":"2026-08-18T02:49:45.535530Z","submitted_at":"2025-05-19T08:29:28Z","title":"Bias Fitting to Mitigate Length Bias of Reward Model in RLHF","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.12843","snapshot_observed_at":"2026-08-01T07:28:18.050097Z","title":"arXiv preprint arXiv:2505.12843 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.21453","last_updated":"2026-07-24T02:14:44Z","snapshot_observed_at":"2026-08-14T09:58:33.194671Z","submitted_at":"2026-07-23T15:55:29Z","title":"Test-Time Scaling via Error Localization","version":2},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-01T07:28:18.050097Z"},"links":{"cited_paper":"/paper/2505.12843","citing_paper":"/paper/2607.21453"},"observation_digest":"sha256:53e457a4620c874d2714be2e086d077b10fee2e3719ebbc8325c6c3a6075d537","observation_id":"12f1842d-a9bb-4ac9-a585-9b1f71f32c38","resolution":{"observed_at":"2026-08-01T07:28:18.050097Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2505.12843/citation-record","integrity":"/paper/2505.12843/integrity","json":"/paper/2505.12843/citation-record.json","paper":"/paper/2505.12843"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2112.00861","last_updated":"2021-12-09T21:40:22Z","snapshot_observed_at":"2026-08-10T12:03:10.373653Z","submitted_at":"2021-12-01T22:24:34Z","title":"A General Language Assistant as a Laboratory for Alignment","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.00861","snapshot_observed_at":"2026-08-15T20:31:01.050427Z","title":"A general language assistant as a laboratory for alignment.arXiv preprint arXiv:2112.00861, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.12843","last_updated":"2026-06-24T10:53:03Z","snapshot_observed_at":"2026-08-18T02:49:45.535530Z","submitted_at":"2025-05-19T08:29:28Z","title":"Bias Fitting to Mitigate Length Bias of Reward Model in RLHF","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-15T20:31:01.050427Z"},"links":{"cited_paper":"/paper/2112.00861","citing_paper":"/paper/2505.12843"},"observation_digest":"sha256:1d11b43df2c548b9f56ff3b58ccff62d84dda6d31589219650d1d450d23cc538","observation_id":"687059e7-1487-40a1-974e-91027e8af4b3","resolution":{"observed_at":"2026-08-15T20:31:01.050427Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:31:02.263117Z","title":"Training a helpful and harmless assistant with reinforcement learning from human feedback, 2022","venue":null,"work_id":"47b27567-09d8-407e-90f1-bc64c1113d15","year":2022},"citing_paper":{"arxiv_id":"2505.12843","last_updated":"2026-06-24T10:53:03Z","snapshot_observed_at":"2026-08-18T02:49:45.535530Z","submitted_at":"2025-05-19T08:29:28Z","title":"Bias Fitting to Mitigate Length Bias of Reward Model in RLHF","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-15T20:31:01.074161Z"},"links":{"citing_paper":"/paper/2505.12843"},"observation_digest":"sha256:a264b7bbd844c107bb5921addbca000580c8468032d3e5b3e38aa6d0849fd879","observation_id":"1ca65930-4c38-49aa-9e68-b3412f374ba1","resolution":{"observed_at":"2026-08-15T20:31:02.269453Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:31:01.100010Z","title":"Rank analysis of incomplete block designs: I","venue":null,"work_id":null,"year":1952},"citing_paper":{"arxiv_id":"2505.12843","last_updated":"2026-06-24T10:53:03Z","snapshot_observed_at":"2026-08-18T02:49:45.535530Z","submitted_at":"2025-05-19T08:29:28Z","title":"Bias Fitting to Mitigate Length Bias of Reward Model in RLHF","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-15T20:31:01.100010Z"},"links":{"citing_paper":"/paper/2505.12843"},"observation_digest":"sha256:dd2b8a0bd392e35034b7bddee1474500ae81ae351dc2b0fd28ae5c4287b1b0b0","observation_id":"f12f60ed-7165-4c6e-a46e-98f9aba21d7e","resolution":{"observed_at":"2026-08-15T20:31:01.100010Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:31:02.237597Z","title":"Noise contrastive alignment of language models with explicit rewards, 2024","venue":null,"work_id":"09245361-8cd6-4db6-ba5f-397b266747ff","year":2024},"citing_paper":{"arxiv_id":"2505.12843","last_updated":"2026-06-24T10:53:03Z","snapshot_observed_at":"2026-08-18T02:49:45.535530Z","submitted_at":"2025-05-19T08:29:28Z","title":"Bias Fitting to Mitigate Length Bias of Reward Model in RLHF","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-15T20:31:01.115523Z"},"links":{"citing_paper":"/paper/2505.12843"},"observation_digest":"sha256:c92836ff9c570577c5af491a471ea554ddbb40112eb354fd27ddec707a976b88","observation_id":"8868765d-b6c9-4a2f-b86d-41ada71ae417","resolution":{"observed_at":"2026-08-15T20:31:02.242923Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:31:02.221998Z","title":"ODIN: Disentangled reward mitigates hacking in RLHF","venue":null,"work_id":"074514eb-6c17-4aea-b923-64abd37e88ec","year":2024},"citing_paper":{"arxiv_id":"2505.12843","last_updated":"2026-06-24T10:53:03Z","snapshot_observed_at":"2026-08-18T02:49:45.535530Z","submitted_at":"2025-05-19T08:29:28Z","title":"Bias Fitting to Mitigate Length Bias of Reward Model in RLHF","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-15T20:31:01.120530Z"},"links":{"citing_paper":"/paper/2505.12843"},"observation_digest":"sha256:a6685e418f0eda2352f2d1324530e3533c3dfb71e5712bcb352d12122a47d636","observation_id":"68bc6e29-fd45-4f2f-b856-df39cac60120","resolution":{"observed_at":"2026-08-15T20:31:02.227345Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:31:01.126627Z","title":"Deepseek-r1: Incentivizing reasoning capability in llms via reinforcement learning, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.12843","last_updated":"2026-06-24T10:53:03Z","snapshot_observed_at":"2026-08-18T02:49:45.535530Z","submitted_at":"2025-05-19T08:29:28Z","title":"Bias Fitting to Mitigate Length Bias of Reward Model in RLHF","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-15T20:31:01.126627Z"},"links":{"citing_paper":"/paper/2505.12843"},"observation_digest":"sha256:bf2dc9c651b6673c058c5888b251e2a003ffcdda0d04fe435723f5e700844e9d","observation_id":"e1febd69-ddd5-41a2-9081-693e79f9f182","resolution":{"observed_at":"2026-08-15T20:31:01.126627Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:31:02.191925Z","title":"Deepseek-v3 technical report, 2025","venue":null,"work_id":"bb2012b2-739d-4824-980a-647b58a783d7","year":2025},"citing_paper":{"arxiv_id":"2505.12843","last_updated":"2026-06-24T10:53:03Z","snapshot_observed_at":"2026-08-18T02:49:45.535530Z","submitted_at":"2025-05-19T08:29:28Z","title":"Bias Fitting to Mitigate Length Bias of Reward Model in RLHF","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-15T20:31:01.133388Z"},"links":{"citing_paper":"/paper/2505.12843"},"observation_digest":"sha256:f226ec8d6c78a06c0acb2832a1c732480062eb042b4325e4bc17261ed85c64b8","observation_id":"cbd7e727-5072-40ec-88c6-d92c1175db1b","resolution":{"observed_at":"2026-08-15T20:31:02.197954Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.06767","last_updated":"2023-12-01T14:28:06Z","snapshot_observed_at":"2026-08-07T04:02:54.504761Z","submitted_at":"2023-04-13T18:22:40Z","title":"RAFT: Reward rAnked FineTuning for Generative Foundation Model Alignment","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.06767","snapshot_observed_at":"2026-08-15T20:31:01.138963Z","title":"Raft: Reward ranked finetuning for generative foundation model alignment.arXiv preprint arXiv:2304.06767, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.12843","last_updated":"2026-06-24T10:53:03Z","snapshot_observed_at":"2026-08-18T02:49:45.535530Z","submitted_at":"2025-05-19T08:29:28Z","title":"Bias Fitting to Mitigate Length Bias of Reward Model in RLHF","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-15T20:31:01.138963Z"},"links":{"cited_paper":"/paper/2304.06767","citing_paper":"/paper/2505.12843"},"observation_digest":"sha256:45b89a73c0cc28f436e2b080cc0eeebf49818d2eeec6e7076079ded938c5d5b8","observation_id":"1d399348-7ffb-40c2-bc44-ac4d26134666","resolution":{"observed_at":"2026-08-15T20:31:01.138963Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:31:01.144235Z","title":"Rlhf workflow: From reward modeling to online rlhf, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.12843","last_updated":"2026-06-24T10:53:03Z","snapshot_observed_at":"2026-08-18T02:49:45.535530Z","submitted_at":"2025-05-19T08:29:28Z","title":"Bias Fitting to Mitigate Length Bias of Reward Model in RLHF","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-15T20:31:01.144235Z"},"links":{"citing_paper":"/paper/2505.12843"},"observation_digest":"sha256:a889271f4326c865ff7c591b7aeac166eafae677c96f04a5a48d43ac30b01b73","observation_id":"d96ae6cc-6e97-4c26-b659-3484f7806aa1","resolution":{"observed_at":"2026-08-15T20:31:01.144235Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.04475","last_updated":"2025-03-10T09:27:03Z","snapshot_observed_at":"2026-07-06T17:56:23.317089Z","submitted_at":"2024-04-06T02:29:02Z","title":"Length-Controlled AlpacaEval: A Simple Way to Debias Automatic Evaluators","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.04475","snapshot_observed_at":"2026-08-15T20:31:01.149460Z","title":"Length-controlled alpacaeval: A simple way to debias automatic evaluators.arXiv preprint arXiv:2404.04475, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.12843","last_updated":"2026-06-24T10:53:03Z","snapshot_observed_at":"2026-08-18T02:49:45.535530Z","submitted_at":"2025-05-19T08:29:28Z","title":"Bias Fitting to Mitigate Length Bias of Reward Model in RLHF","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-15T20:31:01.149460Z"},"links":{"cited_paper":"/paper/2404.04475","citing_paper":"/paper/2505.12843"},"observation_digest":"sha256:9ccc037d3aae16ba515fbb37e0c951fccfaa7034b480cf924901bb79a6ab546a","observation_id":"92b36bd0-66db-4942-a8bb-206cd3b71f28","resolution":{"observed_at":"2026-08-15T20:31:01.149460Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:31:02.164449Z","title":"Helping or herding? re- ward model ensembles mitigate but do not eliminate reward hacking","venue":null,"work_id":"8481a010-3aad-4655-a4e0-79363945811b","year":2024},"citing_paper":{"arxiv_id":"2505.12843","last_updated":"2026-06-24T10:53:03Z","snapshot_observed_at":"2026-08-18T02:49:45.535530Z","submitted_at":"2025-05-19T08:29:28Z","title":"Bias Fitting to Mitigate Length Bias of Reward Model in RLHF","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-15T20:31:01.156657Z"},"links":{"citing_paper":"/paper/2505.12843"},"observation_digest":"sha256:fa4b3d422e50594d1687549a67e7851bf2fd3712c64a44dcdb3f18d4076188a1","observation_id":"895ee927-9f17-4fa9-96fb-e185860aa0ce","resolution":{"observed_at":"2026-08-15T20:31:02.170133Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.01306","last_updated":"2024-11-19T18:12:45Z","snapshot_observed_at":"2026-08-17T15:29:47.883677Z","submitted_at":"2024-02-02T10:53:36Z","title":"KTO: Model Alignment as Prospect Theoretic Optimization","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.01306","snapshot_observed_at":"2026-08-15T20:31:01.162942Z","title":"Kto: Model alignment as prospect theoretic optimization.arXiv preprint arXiv:2402.01306, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.12843","last_updated":"2026-06-24T10:53:03Z","snapshot_observed_at":"2026-08-18T02:49:45.535530Z","submitted_at":"2025-05-19T08:29:28Z","title":"Bias Fitting to Mitigate Length Bias of Reward Model in RLHF","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-15T20:31:01.162942Z"},"links":{"cited_paper":"/paper/2402.01306","citing_paper":"/paper/2505.12843"},"observation_digest":"sha256:8f57a9623bf8a680d4e420d098ca6bf6f5504bf311c288516dd73324f88772e7","observation_id":"5175fce3-dbec-4130-828f-6b4db048fca5","resolution":{"observed_at":"2026-08-15T20:31:01.162942Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:31:02.147729Z","title":"Scaling laws for reward model overoptimization","venue":null,"work_id":"57e2f489-2221-4990-9348-9ab6c4382a28","year":2023},"citing_paper":{"arxiv_id":"2505.12843","last_updated":"2026-06-24T10:53:03Z","snapshot_observed_at":"2026-08-18T02:49:45.535530Z","submitted_at":"2025-05-19T08:29:28Z","title":"Bias Fitting to Mitigate Length Bias of Reward Model in RLHF","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-15T20:31:01.169483Z"},"links":{"citing_paper":"/paper/2505.12843"},"observation_digest":"sha256:fd684333a5600806657f8db484772cdffed6fefc3cc7d502e7df056a15929136","observation_id":"00a8a2f2-ff85-4c42-92a9-3563c8715d8c","resolution":{"observed_at":"2026-08-15T20:31:02.153446Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:31:02.131205Z","title":"A general theoretical paradigm to understand learning from human preferences","venue":null,"work_id":"51a05296-fad5-4c80-88c2-a372227d6dc3","year":2024},"citing_paper":{"arxiv_id":"2505.12843","last_updated":"2026-06-24T10:53:03Z","snapshot_observed_at":"2026-08-18T02:49:45.535530Z","submitted_at":"2025-05-19T08:29:28Z","title":"Bias Fitting to Mitigate Length Bias of Reward Model in RLHF","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-15T20:31:01.176821Z"},"links":{"citing_paper":"/paper/2505.12843"},"observation_digest":"sha256:b763eac86596c9706ee5e16275f6257249234036905f5f2eeee3205b1655bf0f","observation_id":"9f39062b-9580-4429-8b48-74aa5924b5a6","resolution":{"observed_at":"2026-08-15T20:31:02.136000Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:31:01.183228Z","title":"The llama 3 herd of models, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.12843","last_updated":"2026-06-24T10:53:03Z","snapshot_observed_at":"2026-08-18T02:49:45.535530Z","submitted_at":"2025-05-19T08:29:28Z","title":"Bias Fitting to Mitigate Length Bias of Reward Model in RLHF","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-15T20:31:01.183228Z"},"links":{"citing_paper":"/paper/2505.12843"},"observation_digest":"sha256:a4240b245a0f7437dee01a472ae32dad164baca985778a964a33dad8cc549897","observation_id":"091fd5b7-8e92-4857-99b4-3fe00829aab4","resolution":{"observed_at":"2026-08-15T20:31:01.183228Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.00832","last_updated":"2024-11-01T20:02:32Z","snapshot_observed_at":"2026-08-18T02:49:00.286886Z","submitted_at":"2024-06-02T18:42:57Z","title":"BoNBoN Alignment for Large Language Models and the Sweetness of Best-of-n Sampling","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.00832","snapshot_observed_at":"2026-08-15T20:31:01.188382Z","title":"Bonbon alignment for large language models and the sweetness of best-of-n sampling.arXiv preprint arXiv:2406.00832, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.12843","last_updated":"2026-06-24T10:53:03Z","snapshot_observed_at":"2026-08-18T02:49:45.535530Z","submitted_at":"2025-05-19T08:29:28Z","title":"Bias Fitting to Mitigate Length Bias of Reward Model in RLHF","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-15T20:31:01.188382Z"},"links":{"cited_paper":"/paper/2406.00832","citing_paper":"/paper/2505.12843"},"observation_digest":"sha256:2c06b3a38cfc79e03e146baf833daa98177184756c342c9d377daf4d92f2546b","observation_id":"fd0117c1-6cf9-4226-8cb2-79708f860e0e","resolution":{"observed_at":"2026-08-15T20:31:01.188382Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:31:02.103628Z","title":"Deep residual learning for im- age recognition","venue":null,"work_id":"d8340af5-ab0d-456d-a6ac-69bc920c265a","year":2016},"citing_paper":{"arxiv_id":"2505.12843","last_updated":"2026-06-24T10:53:03Z","snapshot_observed_at":"2026-08-18T02:49:45.535530Z","submitted_at":"2025-05-19T08:29:28Z","title":"Bias Fitting to Mitigate Length Bias of Reward Model in RLHF","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-15T20:31:01.198616Z"},"links":{"citing_paper":"/paper/2505.12843"},"observation_digest":"sha256:30ad2bab26ccd866f87697274f233ebd9888dd821e10fe364bde82c06bb0ca4a","observation_id":"fe66a8c7-218f-4903-9363-d582253f066f","resolution":{"observed_at":"2026-08-15T20:31:02.109230Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:31:02.081866Z","title":"ORPO: Monolithic preference optimization without reference model","venue":null,"work_id":"09a50d60-f781-4970-a482-b84dc1e73c1e","year":2024},"citing_paper":{"arxiv_id":"2505.12843","last_updated":"2026-06-24T10:53:03Z","snapshot_observed_at":"2026-08-18T02:49:45.535530Z","submitted_at":"2025-05-19T08:29:28Z","title":"Bias Fitting to Mitigate Length Bias of Reward Model in RLHF","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-15T20:31:01.205375Z"},"links":{"citing_paper":"/paper/2505.12843"},"observation_digest":"sha256:7b3584868a4a0f88e8c1354cd1e3aeb516ca22b20612f4e658f3da492674023d","observation_id":"74341c34-490e-4297-a989-a09a27556a28","resolution":{"observed_at":"2026-08-15T20:31:02.089711Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:31:02.064172Z","title":"Post-hoc reward calibra- tion: A case study on length bias","venue":null,"work_id":"97cd745d-604f-4e6b-84ee-6f5eae70c294","year":2025},"citing_paper":{"arxiv_id":"2505.12843","last_updated":"2026-06-24T10:53:03Z","snapshot_observed_at":"2026-08-18T02:49:45.535530Z","submitted_at":"2025-05-19T08:29:28Z","title":"Bias Fitting to Mitigate Length Bias of Reward Model in RLHF","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-15T20:31:01.210800Z"},"links":{"citing_paper":"/paper/2505.12843"},"observation_digest":"sha256:7ca2293367a800232c5d5bdc6c0d53e158a8434356a8a65a0dcad00f321bc24f","observation_id":"461bde1b-68cd-415b-9a4b-068b4cb0c487","resolution":{"observed_at":"2026-08-15T20:31:02.070083Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:31:01.217132Z","title":"Gonzalez, Hao Zhang, and Ion Stoica","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.12843","last_updated":"2026-06-24T10:53:03Z","snapshot_observed_at":"2026-08-18T02:49:45.535530Z","submitted_at":"2025-05-19T08:29:28Z","title":"Bias Fitting to Mitigate Length Bias of Reward Model in RLHF","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-15T20:31:01.217132Z"},"links":{"citing_paper":"/paper/2505.12843"},"observation_digest":"sha256:60335106087ec8be828d098d5eaa5eee50360fdd9215d6458f5d5ba8fd336a94","observation_id":"78169754-008c-4a47-93ab-923e4ca0c041","resolution":{"observed_at":"2026-08-15T20:31:01.217132Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:31:02.031821Z","title":"Openassistant conversations -democratizing large language model alignment","venue":null,"work_id":"db0d06fe-2a96-4911-9ba9-02929299e321","year":null},"citing_paper":{"arxiv_id":"2505.12843","last_updated":"2026-06-24T10:53:03Z","snapshot_observed_at":"2026-08-18T02:49:45.535530Z","submitted_at":"2025-05-19T08:29:28Z","title":"Bias Fitting to Mitigate Length Bias of Reward Model in RLHF","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-15T20:31:01.223306Z"},"links":{"citing_paper":"/paper/2505.12843"},"observation_digest":"sha256:9f271870cdf5016fc4acf368338bb1a2e9dd64fd9350f0dec1879410e9abb383","observation_id":"021ab3bf-76ee-4e76-89d0-184714636678","resolution":{"observed_at":"2026-08-15T20:31:02.037894Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.00168","last_updated":"2024-02-02T03:41:50Z","snapshot_observed_at":"2026-08-16T14:47:02.611749Z","submitted_at":"2023-10-31T21:52:41Z","title":"The Alignment Ceiling: Objective Mismatch in Reinforcement Learning from Human Feedback","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.00168","snapshot_observed_at":"2026-08-15T20:31:01.230482Z","title":"The alignment ceiling: Objective mismatch in rein- forcement learning from human feedback.arXiv preprint arXiv:2311.00168, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.12843","last_updated":"2026-06-24T10:53:03Z","snapshot_observed_at":"2026-08-18T02:49:45.535530Z","submitted_at":"2025-05-19T08:29:28Z","title":"Bias Fitting to Mitigate Length Bias of Reward Model in RLHF","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-15T20:31:01.230482Z"},"links":{"cited_paper":"/paper/2311.00168","citing_paper":"/paper/2505.12843"},"observation_digest":"sha256:bb20c1515130aadd0f85a5f3f0fae6df16227d4a59f450bebd7104df08100750","observation_id":"2d3a95c6-e250-4a0b-8ff2-59dfa125a0ef","resolution":{"observed_at":"2026-08-15T20:31:01.230482Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:31:02.012239Z","title":"RRM: Robust reward model training mitigates reward hacking","venue":null,"work_id":"4a0e7ad7-6038-4ed0-a305-27cff6a4f410","year":2025},"citing_paper":{"arxiv_id":"2505.12843","last_updated":"2026-06-24T10:53:03Z","snapshot_observed_at":"2026-08-18T02:49:45.535530Z","submitted_at":"2025-05-19T08:29:28Z","title":"Bias Fitting to Mitigate Length Bias of Reward Model in RLHF","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-15T20:31:01.236592Z"},"links":{"citing_paper":"/paper/2505.12843"},"observation_digest":"sha256:af04b342400c243a0de10bfcfc4cb1cd9160186b94c92f7c3d34abbebe74d5e1","observation_id":"73322ea2-4061-4ac9-aab0-9f0e9fb8f00b","resolution":{"observed_at":"2026-08-15T20:31:02.019581Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:31:01.994040Z","title":"Simpo: Simple preference optimization with a reference-free reward","venue":null,"work_id":"760a1cfa-79ab-4769-ac06-7e6d228b86cd","year":2024},"citing_paper":{"arxiv_id":"2505.12843","last_updated":"2026-06-24T10:53:03Z","snapshot_observed_at":"2026-08-18T02:49:45.535530Z","submitted_at":"2025-05-19T08:29:28Z","title":"Bias Fitting to Mitigate Length Bias of Reward Model in RLHF","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-15T20:31:01.242997Z"},"links":{"citing_paper":"/paper/2505.12843"},"observation_digest":"sha256:8a44eeeb3fd4b0b0dbc15976f93b410d2c8a6a016cf66b0e28c543836243408a","observation_id":"ab8961fa-4a15-4bd6-b065-bbda41a69a15","resolution":{"observed_at":"2026-08-15T20:31:01.999843Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:31:01.975558Z","title":"Expanding on what we missed with sycophancy, 2025","venue":null,"work_id":"3cda85c8-0cdd-4580-a9c1-2b751d78dabd","year":2025},"citing_paper":{"arxiv_id":"2505.12843","last_updated":"2026-06-24T10:53:03Z","snapshot_observed_at":"2026-08-18T02:49:45.535530Z","submitted_at":"2025-05-19T08:29:28Z","title":"Bias Fitting to Mitigate Length Bias of Reward Model in RLHF","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-15T20:31:01.248564Z"},"links":{"citing_paper":"/paper/2505.12843"},"observation_digest":"sha256:d8057a06ab6fbc89128ebb3f4c084e8be112ee4a82b39747f6243cf44a644bdf","observation_id":"a758781c-ef87-4653-ab11-23cc8fff87c8","resolution":{"observed_at":"2026-08-15T20:31:01.981268Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:31:01.959035Z","title":"Gpt-4 technical report, 2024","venue":null,"work_id":"8e6046dd-f372-4489-929b-a9c151775a19","year":2024},"citing_paper":{"arxiv_id":"2505.12843","last_updated":"2026-06-24T10:53:03Z","snapshot_observed_at":"2026-08-18T02:49:45.535530Z","submitted_at":"2025-05-19T08:29:28Z","title":"Bias Fitting to Mitigate Length Bias of Reward Model in RLHF","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-15T20:31:01.253305Z"},"links":{"citing_paper":"/paper/2505.12843"},"observation_digest":"sha256:e38ce2633cf4013d8923bb597f9ec9f3df91d9d9e49cf26274c37ba94e7c7e4d","observation_id":"77de0340-a9e3-4520-94d6-15af306c4b2d","resolution":{"observed_at":"2026-08-15T20:31:01.964195Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:31:01.271309Z","title":"Training language models to follow instructions with human feedback.Advances in neural information processing systems, 35:27730–27744, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.12843","last_updated":"2026-06-24T10:53:03Z","snapshot_observed_at":"2026-08-18T02:49:45.535530Z","submitted_at":"2025-05-19T08:29:28Z","title":"Bias Fitting to Mitigate Length Bias of Reward Model in RLHF","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-15T20:31:01.271309Z"},"links":{"citing_paper":"/paper/2505.12843"},"observation_digest":"sha256:ad354f95a656493ba7d553968fe7553b1e647cfaa9f5ec89a403af2c6964f486","observation_id":"5cd313b5-52c4-4f27-a8c4-4934d7f0dab3","resolution":{"observed_at":"2026-08-15T20:31:01.271309Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:31:01.932872Z","title":"Reward gaming in conditional text generation","venue":null,"work_id":"e0c79f24-6324-4f6c-91d4-ff2f62af0ecf","year":2023},"citing_paper":{"arxiv_id":"2505.12843","last_updated":"2026-06-24T10:53:03Z","snapshot_observed_at":"2026-08-18T02:49:45.535530Z","submitted_at":"2025-05-19T08:29:28Z","title":"Bias Fitting to Mitigate Length Bias of Reward Model in RLHF","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-15T20:31:01.276692Z"},"links":{"citing_paper":"/paper/2505.12843"},"observation_digest":"sha256:3ff7334f2d6907fb5d91a341f939e1475eac356e6052c0db71dffc27c7d8cb4c","observation_id":"0a0d94a4-fffc-452d-9a16-c2a02c146196","resolution":{"observed_at":"2026-08-15T20:31:01.937446Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1912.01703","last_updated":"2019-12-03T22:06:05Z","snapshot_observed_at":"2026-07-06T08:41:49.632205Z","submitted_at":"2019-12-03T22:06:05Z","title":"PyTorch: An Imperative Style, High-Performance Deep Learning Library","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1912.01703","snapshot_observed_at":"2026-08-15T20:31:01.283312Z","title":"Pytorch: An imperative style, high-performance deep learning library.CoRR, abs/1912.01703, 2019","venue":null,"work_id":null,"year":1912},"citing_paper":{"arxiv_id":"2505.12843","last_updated":"2026-06-24T10:53:03Z","snapshot_observed_at":"2026-08-18T02:49:45.535530Z","submitted_at":"2025-05-19T08:29:28Z","title":"Bias Fitting to Mitigate Length Bias of Reward Model in RLHF","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-15T20:31:01.283312Z"},"links":{"cited_paper":"/paper/1912.01703","citing_paper":"/paper/2505.12843"},"observation_digest":"sha256:b5387cb729c5bfccffcfb1d526fbe3831b976e52e4efb7cb2e30b15be990b56f","observation_id":"2627ea87-679b-48fb-893d-a7fc06ed9222","resolution":{"observed_at":"2026-08-15T20:31:01.283312Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:31:01.918168Z","title":"Notes on regression and inheritance in the case of two parents.Proceedings of the Royal Society of London, 58:240–242, 1895","venue":null,"work_id":"db8cf18f-53e0-4ced-bed5-9d43c5c4e838","year":null},"citing_paper":{"arxiv_id":"2505.12843","last_updated":"2026-06-24T10:53:03Z","snapshot_observed_at":"2026-08-18T02:49:45.535530Z","submitted_at":"2025-05-19T08:29:28Z","title":"Bias Fitting to Mitigate Length Bias of Reward Model in RLHF","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-15T20:31:01.290347Z"},"links":{"citing_paper":"/paper/2505.12843"},"observation_digest":"sha256:d6b915be5803a3f0c096dd17cd27f543c26a53823de1b30d778a5476335efbfa","observation_id":"d92e127b-ad5e-4f4c-a8c4-19e72c3bb138","resolution":{"observed_at":"2026-08-15T20:31:01.922834Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:31:01.901861Z","title":"Qwen2.5 technical report, 2025","venue":null,"work_id":"c661db76-8db3-4c4d-b6d6-d0aeffe31cee","year":2025},"citing_paper":{"arxiv_id":"2505.12843","last_updated":"2026-06-24T10:53:03Z","snapshot_observed_at":"2026-08-18T02:49:45.535530Z","submitted_at":"2025-05-19T08:29:28Z","title":"Bias Fitting to Mitigate Length Bias of Reward Model in RLHF","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-15T20:31:01.296424Z"},"links":{"citing_paper":"/paper/2505.12843"},"observation_digest":"sha256:2a32cbc0dd9a57af962615d2ab459c0ddc4557c93b4abdf32356ae2e90425517","observation_id":"37e87cc3-4853-45bc-90ff-18db27b3ab96","resolution":{"observed_at":"2026-08-15T20:31:01.906666Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:31:01.300971Z","title":"Direct preference optimization: Your language model is secretly a reward model","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.12843","last_updated":"2026-06-24T10:53:03Z","snapshot_observed_at":"2026-08-18T02:49:45.535530Z","submitted_at":"2025-05-19T08:29:28Z","title":"Bias Fitting to Mitigate Length Bias of Reward Model in RLHF","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-15T20:31:01.300971Z"},"links":{"citing_paper":"/paper/2505.12843"},"observation_digest":"sha256:d69f0a40a440ea3c5b3846c9e14fa034b90895ec5c65a8ba1a5ee05b6bfe3275","observation_id":"9a55eee8-8a33-4a5b-aa8e-d25da946b6d6","resolution":{"observed_at":"2026-08-15T20:31:01.300971Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:31:01.307466Z","title":"Warp: On the benefits of weight averaged rewarded policies, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.12843","last_updated":"2026-06-24T10:53:03Z","snapshot_observed_at":"2026-08-18T02:49:45.535530Z","submitted_at":"2025-05-19T08:29:28Z","title":"Bias Fitting to Mitigate Length Bias of Reward Model in RLHF","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-15T20:31:01.307466Z"},"links":{"citing_paper":"/paper/2505.12843"},"observation_digest":"sha256:70a7d0103d48cc72cbc775092fb0efef4c754127b1f27e3d33c6486ff92fd56e","observation_id":"7b0b67e2-78f0-45f2-9c4e-f6777a4f5f11","resolution":{"observed_at":"2026-08-15T20:31:01.307466Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:31:01.860662Z","title":"Warm: On the benefits of weight averaged reward models, 2024","venue":null,"work_id":"027005b4-5c98-4d26-986e-f7dd6db72c0a","year":2024},"citing_paper":{"arxiv_id":"2505.12843","last_updated":"2026-06-24T10:53:03Z","snapshot_observed_at":"2026-08-18T02:49:45.535530Z","submitted_at":"2025-05-19T08:29:28Z","title":"Bias Fitting to Mitigate Length Bias of Reward Model in RLHF","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-15T20:31:01.313692Z"},"links":{"citing_paper":"/paper/2505.12843"},"observation_digest":"sha256:e4174ffe189021c842b992879bbb6d2929ff7dca9534c329830bf24152e1004a","observation_id":"b5c25c3d-c1a6-4e36-a4ea-024a25c267d7","resolution":{"observed_at":"2026-08-15T20:31:01.867011Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:31:01.844680Z","title":"Deepspeed: System optimizations enable training deep learning models with over 100 billion parameters","venue":null,"work_id":"e9a6c346-b72c-4c21-85b8-6f02e4268358","year":2020},"citing_paper":{"arxiv_id":"2505.12843","last_updated":"2026-06-24T10:53:03Z","snapshot_observed_at":"2026-08-18T02:49:45.535530Z","submitted_at":"2025-05-19T08:29:28Z","title":"Bias Fitting to Mitigate Length Bias of Reward Model in RLHF","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-15T20:31:01.319597Z"},"links":{"citing_paper":"/paper/2505.12843"},"observation_digest":"sha256:5acd6cba25e3dec3128606753a644ddb63dc359878928bd2b7efd79fadcb0f1a","observation_id":"d6da3a41-b5bf-438e-a7b8-50564ac0918e","resolution":{"observed_at":"2026-08-15T20:31:01.850062Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:31:01.827942Z","title":"Offline regularised reinforcement learning for large language models alignment, 2024","venue":null,"work_id":"f5b56853-b766-4a55-ad25-dc0db7721d91","year":2024},"citing_paper":{"arxiv_id":"2505.12843","last_updated":"2026-06-24T10:53:03Z","snapshot_observed_at":"2026-08-18T02:49:45.535530Z","submitted_at":"2025-05-19T08:29:28Z","title":"Bias Fitting to Mitigate Length Bias of Reward Model in RLHF","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-15T20:31:01.324999Z"},"links":{"citing_paper":"/paper/2505.12843"},"observation_digest":"sha256:0acec90944f6cd13c4363b0771bcdbbfaff8568f7ae64ed2dcff6b5c62f4d3bb","observation_id":"0b795c10-9d72-4afb-9121-51894a263dde","resolution":{"observed_at":"2026-08-15T20:31:01.834087Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-08-15T20:26:32.102285Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-15T20:31:01.329871Z","title":"Proximal policy optimization algorithms.arXiv preprint arXiv:1707.06347, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.12843","last_updated":"2026-06-24T10:53:03Z","snapshot_observed_at":"2026-08-18T02:49:45.535530Z","submitted_at":"2025-05-19T08:29:28Z","title":"Bias Fitting to Mitigate Length Bias of Reward Model in RLHF","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-15T20:31:01.329871Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2505.12843"},"observation_digest":"sha256:835b456fe50fecd6fb053f8333e7cb7db7dfd57617500c0da44a5744a5d4749c","observation_id":"18fb0222-e90a-43ce-9ef6-c3ceb3a0cfba","resolution":{"observed_at":"2026-08-15T20:31:01.329871Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.14622","last_updated":"2024-07-19T18:38:25Z","snapshot_observed_at":"2026-08-16T13:32:36.823054Z","submitted_at":"2024-07-19T18:38:25Z","title":"BOND: Aligning LLMs with Best-of-N Distillation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.14622","snapshot_observed_at":"2026-08-15T20:31:01.335192Z","title":"Bond: Aligning llms with best-of-n distillation.arXiv preprint arXiv:2407.14622, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.12843","last_updated":"2026-06-24T10:53:03Z","snapshot_observed_at":"2026-08-18T02:49:45.535530Z","submitted_at":"2025-05-19T08:29:28Z","title":"Bias Fitting to Mitigate Length Bias of Reward Model in RLHF","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-15T20:31:01.335192Z"},"links":{"cited_paper":"/paper/2407.14622","citing_paper":"/paper/2505.12843"},"observation_digest":"sha256:b6e502660d2afe0dd64d34395623e3bff7c2f41d7e029e0cf60a3fec7ad76f3c","observation_id":"94b50415-f300-4540-aae8-db9f96f76aee","resolution":{"observed_at":"2026-08-15T20:31:01.335192Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-15T20:31:01.340582Z","title":"Deepseekmath: Pushing the limits of mathematical reasoning in open language models.arXiv preprint arXiv:2402.03300, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.12843","last_updated":"2026-06-24T10:53:03Z","snapshot_observed_at":"2026-08-18T02:49:45.535530Z","submitted_at":"2025-05-19T08:29:28Z","title":"Bias Fitting to Mitigate Length Bias of Reward Model in RLHF","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-15T20:31:01.340582Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2505.12843"},"observation_digest":"sha256:0078775a27202820fa6febf907f40a278933aec732716fe7d695590e8d85c2ad","observation_id":"1a72128c-6975-459e-8d5c-fba75b26620a","resolution":{"observed_at":"2026-08-15T20:31:01.340582Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:31:01.811758Z","title":"Loose lips sink ships: Mitigating length bias in reinforcement learning from human feedback","venue":null,"work_id":"4fcfe3e6-aa31-47ec-83d4-fdc37410b979","year":2023},"citing_paper":{"arxiv_id":"2505.12843","last_updated":"2026-06-24T10:53:03Z","snapshot_observed_at":"2026-08-18T02:49:45.535530Z","submitted_at":"2025-05-19T08:29:28Z","title":"Bias Fitting to Mitigate Length Bias of Reward Model in RLHF","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-15T20:31:01.346657Z"},"links":{"citing_paper":"/paper/2505.12843"},"observation_digest":"sha256:2333ea1d176ac9262df2543479dd85fef6ff522ebdb1efb07950971e1d8e21b2","observation_id":"bbd4fdcf-3d6d-4e65-96e9-9abeffdcf289","resolution":{"observed_at":"2026-08-15T20:31:01.817025Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.03716","last_updated":"2024-07-10T23:15:49Z","snapshot_observed_at":"2026-08-16T14:54:43.078629Z","submitted_at":"2023-10-05T17:38:28Z","title":"A Long Way to Go: Investigating Length Correlations in RLHF","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.03716","snapshot_observed_at":"2026-08-15T20:31:01.360484Z","title":"A long way to go: Investigating length correlations in rlhf.arXiv preprint arXiv:2310.03716, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.12843","last_updated":"2026-06-24T10:53:03Z","snapshot_observed_at":"2026-08-18T02:49:45.535530Z","submitted_at":"2025-05-19T08:29:28Z","title":"Bias Fitting to Mitigate Length Bias of Reward Model in RLHF","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-15T20:31:01.360484Z"},"links":{"cited_paper":"/paper/2310.03716","citing_paper":"/paper/2505.12843"},"observation_digest":"sha256:6e6d26be6b5876a4914a5ed09b3b58469be531cb729d37e44459580517993944","observation_id":"f0ccf053-ec92-44ca-8847-175f6aa45da3","resolution":{"observed_at":"2026-08-15T20:31:01.360484Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:31:01.365962Z","title":"Ziegler, Ryan Lowe, Chelsea V oss, Alec Radford, Dario Amodei, and Paul Christiano","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.12843","last_updated":"2026-06-24T10:53:03Z","snapshot_observed_at":"2026-08-18T02:49:45.535530Z","submitted_at":"2025-05-19T08:29:28Z","title":"Bias Fitting to Mitigate Length Bias of Reward Model in RLHF","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-15T20:31:01.365962Z"},"links":{"citing_paper":"/paper/2505.12843"},"observation_digest":"sha256:783de9f1d040a097a2f69dd544b876f6618ce2f8d0e01926400086963f2f1cd7","observation_id":"6d44421d-76c1-4dc6-94a5-d28e21e8aac4","resolution":{"observed_at":"2026-08-15T20:31:01.365962Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:31:01.370763Z","title":"Learning to summarize with human feedback","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.12843","last_updated":"2026-06-24T10:53:03Z","snapshot_observed_at":"2026-08-18T02:49:45.535530Z","submitted_at":"2025-05-19T08:29:28Z","title":"Bias Fitting to Mitigate Length Bias of Reward Model in RLHF","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-15T20:31:01.370763Z"},"links":{"citing_paper":"/paper/2505.12843"},"observation_digest":"sha256:714dbb9022cb5a13524b733574835c1df157234d3c0902353e5b56a66fb9dcd4","observation_id":"c6973f78-33e7-4b84-83db-5d1a703a0c78","resolution":{"observed_at":"2026-08-15T20:31:01.370763Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:31:01.772904Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context, 2024","venue":null,"work_id":"355d0026-7128-4eb1-8ee3-fed8230c1f89","year":2024},"citing_paper":{"arxiv_id":"2505.12843","last_updated":"2026-06-24T10:53:03Z","snapshot_observed_at":"2026-08-18T02:49:45.535530Z","submitted_at":"2025-05-19T08:29:28Z","title":"Bias Fitting to Mitigate Length Bias of Reward Model in RLHF","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-15T20:31:01.376369Z"},"links":{"citing_paper":"/paper/2505.12843"},"observation_digest":"sha256:0c3fd0cb59bd38522e6c249e19c5fc7e97245f752797d51a28037ad54eeae540","observation_id":"d4a46a08-4386-4d1e-86f5-7e78004053c8","resolution":{"observed_at":"2026-08-15T20:31:01.778601Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:31:01.381925Z","title":"Llama 2: Open foundation and fine-tuned chat models, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.12843","last_updated":"2026-06-24T10:53:03Z","snapshot_observed_at":"2026-08-18T02:49:45.535530Z","submitted_at":"2025-05-19T08:29:28Z","title":"Bias Fitting to Mitigate Length Bias of Reward Model in RLHF","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-15T20:31:01.381925Z"},"links":{"citing_paper":"/paper/2505.12843"},"observation_digest":"sha256:97e2b1d3a1b6a9a0fce68582a148e411ccff42129324e33469873957300f9740","observation_id":"75dc0f5f-8422-4368-853e-d3a0f1184e20","resolution":{"observed_at":"2026-08-15T20:31:01.381925Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:31:01.386796Z","title":"Attention is all you need","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.12843","last_updated":"2026-06-24T10:53:03Z","snapshot_observed_at":"2026-08-18T02:49:45.535530Z","submitted_at":"2025-05-19T08:29:28Z","title":"Bias Fitting to Mitigate Length Bias of Reward Model in RLHF","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-15T20:31:01.386796Z"},"links":{"citing_paper":"/paper/2505.12843"},"observation_digest":"sha256:3335ddd8418ab6c248012deee9426c8d03c8c2c2faae4dd2cd631c2e236cba2b","observation_id":"ff50780c-1bc8-4d80-824d-ddc9add43235","resolution":{"observed_at":"2026-08-15T20:31:01.386796Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:31:01.732808Z","title":"Reward hacking in reinforcement learning, Nov 2024","venue":null,"work_id":"41a867af-85ec-4830-8429-35427d1fb2c7","year":2024},"citing_paper":{"arxiv_id":"2505.12843","last_updated":"2026-06-24T10:53:03Z","snapshot_observed_at":"2026-08-18T02:49:45.535530Z","submitted_at":"2025-05-19T08:29:28Z","title":"Bias Fitting to Mitigate Length Bias of Reward Model in RLHF","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-15T20:31:01.391674Z"},"links":{"citing_paper":"/paper/2505.12843"},"observation_digest":"sha256:5c2b8303f9e7cd4326ed7ef3a22c6938cb0de1a99e7092d7a984f0e41ecd19a1","observation_id":"7a4b8528-1e2e-42d9-8532-c0aef22b84d4","resolution":{"observed_at":"2026-08-15T20:31:01.738195Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:31:01.397242Z","title":"Qwen2 technical report, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.12843","last_updated":"2026-06-24T10:53:03Z","snapshot_observed_at":"2026-08-18T02:49:45.535530Z","submitted_at":"2025-05-19T08:29:28Z","title":"Bias Fitting to Mitigate Length Bias of Reward Model in RLHF","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-15T20:31:01.397242Z"},"links":{"citing_paper":"/paper/2505.12843"},"observation_digest":"sha256:85f87b0f82b67461ff846d8078c1bbcf60d56528d52ef466edee511c87492756","observation_id":"08881065-5386-42bb-9196-9ca184a1626c","resolution":{"observed_at":"2026-08-15T20:31:01.397242Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:31:01.701689Z","title":"Dapo: An open-source llm reinforcement learning system at scale, 2025","venue":null,"work_id":"2f74d92f-feec-4c45-86a3-f604d2077eb8","year":2025},"citing_paper":{"arxiv_id":"2505.12843","last_updated":"2026-06-24T10:53:03Z","snapshot_observed_at":"2026-08-18T02:49:45.535530Z","submitted_at":"2025-05-19T08:29:28Z","title":"Bias Fitting to Mitigate Length Bias of Reward Model in RLHF","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-15T20:31:01.402730Z"},"links":{"citing_paper":"/paper/2505.12843"},"observation_digest":"sha256:cb9255cb9c91e833ed1be9bb695852a6400560a8800908cfb691c0d9da5b6c33","observation_id":"fe08b45c-ef18-4e96-8f0e-097c11063e79","resolution":{"observed_at":"2026-08-15T20:31:01.707100Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:31:01.681191Z","title":"From lists to emojis: How format bias affects model alignment, 2024","venue":null,"work_id":"672e89ed-b96e-47f0-80f4-b44466fa60a8","year":2024},"citing_paper":{"arxiv_id":"2505.12843","last_updated":"2026-06-24T10:53:03Z","snapshot_observed_at":"2026-08-18T02:49:45.535530Z","submitted_at":"2025-05-19T08:29:28Z","title":"Bias Fitting to Mitigate Length Bias of Reward Model in RLHF","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-15T20:31:01.408429Z"},"links":{"citing_paper":"/paper/2505.12843"},"observation_digest":"sha256:ca0219a7f5490264fcfdc3c7c849d3318176814390bf79f378ae4246bf74df57","observation_id":"947656c9-9a9e-41d4-9a11-c51b5d8c3a15","resolution":{"observed_at":"2026-08-15T20:31:01.686042Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:31:01.660679Z","title":"Fine-tuning language models from human preferences, 2020.URL https://arxiv","venue":null,"work_id":"3e6dc004-4696-47f7-8571-364d5142b6ec","year":2020},"citing_paper":{"arxiv_id":"2505.12843","last_updated":"2026-06-24T10:53:03Z","snapshot_observed_at":"2026-08-18T02:49:45.535530Z","submitted_at":"2025-05-19T08:29:28Z","title":"Bias Fitting to Mitigate Length Bias of Reward Model in RLHF","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-15T20:31:01.415106Z"},"links":{"citing_paper":"/paper/2505.12843"},"observation_digest":"sha256:65836fb38f29320cbfc6daf1a075656b29d4c5ff1a5f441a0be4cac0a7b4ca45","observation_id":"b184816d-d7cd-4090-838b-07fa64a1387e","resolution":{"observed_at":"2026-08-15T20:31:01.668211Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2505.12843","last_updated":"2026-06-24T10:53:03Z","latest_version":2,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-18T02:49:45.535530Z","submitted_at":"2025-05-19T08:29:28Z","title":"Bias Fitting to Mitigate Length Bias of Reward Model in RLHF"},"reference_resolution":{"displayed":51,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":24,"verified_exact":0,"verified_fuzzy":27},"total_outbound_references":51},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"thesis":"As of 18 August 2026, this Paper Citation Record lists 51 of 51 outbound references and 4 inbound Pith citation observations for arXiv:2505.12843."}