{"as_of":"2026-08-10T02:39:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:d83a6f7271802ba21ea5e6c13cce58e25d82f3217db44f8812e016cd7e5295c2","coverage":[{"denominator":57,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":57,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-09T17:46:29.322067Z","state":"measured"},{"denominator":60,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":60,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":3,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":3,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-19T09:40:58.067398Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-19T09:42:14.018543Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2502.00814","last_updated":"2025-05-19T08:24:51Z","snapshot_observed_at":"2026-08-09T17:35:35.604319Z","submitted_at":"2025-02-02T14:50:25Z","title":"Disentangling Length Bias In Preference Learning Via Response-Conditioned Modeling","version":2},"cited_work":{"arxiv_id":"2502.00814","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.00814","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Disentangling length bias in preference learning via response-conditioned modeling","venue":null,"work_id":"d9bdbd96-c9f8-471b-96b8-d067db6b327a","year":2025},"citing_paper":{"arxiv_id":"2506.12382","last_updated":"2026-04-27T08:32:16Z","snapshot_observed_at":"2026-08-02T04:53:57.144183Z","submitted_at":"2025-06-14T07:31:52Z","title":"Exploring the Secondary Risks of Large Language Models","version":5},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-19T09:40:58.067398Z"},"links":{"cited_paper":"/paper/2502.00814","citing_paper":"/paper/2506.12382"},"observation_digest":"sha256:1fb6461891d53ca76c1b0cd7ca1a21cf983e257e5ff437c840e6a5d83c6dcda5","observation_id":"02c42889-d3d5-4bcb-b8e2-d9ce36aaa618","resolution":{"observed_at":"2026-05-19T09:42:14.020377Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.00814","last_updated":"2025-05-19T08:24:51Z","snapshot_observed_at":"2026-08-09T17:35:35.604319Z","submitted_at":"2025-02-02T14:50:25Z","title":"Disentangling Length Bias In Preference Learning Via Response-Conditioned Modeling","version":2},"cited_work":{"arxiv_id":"2502.00814","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.00814","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Disentangling length bias in preference learning via response-conditioned modeling","venue":null,"work_id":"d9bdbd96-c9f8-471b-96b8-d067db6b327a","year":2025},"citing_paper":{"arxiv_id":"2604.17328","last_updated":"2026-05-23T14:02:35Z","snapshot_observed_at":"2026-07-06T23:04:28.260463Z","submitted_at":"2026-04-19T08:48:46Z","title":"Rethinking the Comparison Unit in Sequence-Level Reinforcement Learning: An Equal-Length Paired Training Framework from Loss Correction to Sample Construction","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-05-10T06:23:14.905706Z"},"links":{"cited_paper":"/paper/2502.00814","citing_paper":"/paper/2604.17328"},"observation_digest":"sha256:8eb2a4b62d870d582f24aff4036e91797dd7611eac14f896dd35e44a8b8ded8a","observation_id":"35d456f8-5298-4500-804d-5153ae5aaa8e","resolution":{"observed_at":"2026-05-10T06:26:27.559015Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.00814","last_updated":"2025-05-19T08:24:51Z","snapshot_observed_at":"2026-08-09T17:35:35.604319Z","submitted_at":"2025-02-02T14:50:25Z","title":"Disentangling Length Bias In Preference Learning Via Response-Conditioned Modeling","version":2},"cited_work":{"arxiv_id":"2502.00814","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.00814","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Disentangling length bias in preference learning via response-conditioned modeling","venue":null,"work_id":"d9bdbd96-c9f8-471b-96b8-d067db6b327a","year":2025},"citing_paper":{"arxiv_id":"2604.21911","last_updated":"2026-04-23T17:54:36Z","snapshot_observed_at":"2026-07-06T23:08:23.939574Z","submitted_at":"2026-04-23T17:54:36Z","title":"When Prompts Override Vision: Prompt-Induced Hallucinations in LVLMs","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-09T22:11:40.905814Z"},"links":{"cited_paper":"/paper/2502.00814","citing_paper":"/paper/2604.21911"},"observation_digest":"sha256:9b488a54ede3a050742c78926c56599999e5f3ad2573611814fe0e76353f0c24","observation_id":"7f107fd6-152e-4728-859a-cb51dd97adeb","resolution":{"observed_at":"2026-05-11T14:16:09.497274Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2502.00814/citation-record","integrity":"/paper/2502.00814/integrity","json":"/paper/2502.00814/citation-record.json","paper":"/paper/2502.00814"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-09T17:46:29.116171Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.00814","last_updated":"2025-05-19T08:24:51Z","snapshot_observed_at":"2026-08-09T17:35:35.604319Z","submitted_at":"2025-02-02T14:50:25Z","title":"Disentangling Length Bias In Preference Learning Via Response-Conditioned Modeling","version":2},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-09T17:46:29.116171Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2502.00814"},"observation_digest":"sha256:204efdb35cc9303c941698e7e9b567384cfa6d0e6cd92b1ff669ad8c8f1e2d02","observation_id":"2e56f5ee-7e9f-43eb-a339-7cec12a716b0","resolution":{"observed_at":"2026-08-09T17:46:29.116171Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.05862","last_updated":"2022-04-12T15:02:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-04-12T15:02:38Z","title":"Training a Helpful and Harmless Assistant with Reinforcement Learning from Human Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.05862","snapshot_observed_at":"2026-08-09T17:46:29.120431Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.00814","last_updated":"2025-05-19T08:24:51Z","snapshot_observed_at":"2026-08-09T17:35:35.604319Z","submitted_at":"2025-02-02T14:50:25Z","title":"Disentangling Length Bias In Preference Learning Via Response-Conditioned Modeling","version":2},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-09T17:46:29.120431Z"},"links":{"cited_paper":"/paper/2204.05862","citing_paper":"/paper/2502.00814"},"observation_digest":"sha256:26ce2ea6621a977ca3194a2652fea9344f2786603cecf00f1803277efa9fe712","observation_id":"1e687054-2d8a-4129-afdf-829a66dce354","resolution":{"observed_at":"2026-08-09T17:46:29.120431Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.08073","last_updated":"2022-12-15T06:19:23Z","snapshot_observed_at":"2026-08-02T04:53:58.766070Z","submitted_at":"2022-12-15T06:19:23Z","title":"Constitutional AI: Harmlessness from AI Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.08073","snapshot_observed_at":"2026-08-09T17:46:29.124817Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.00814","last_updated":"2025-05-19T08:24:51Z","snapshot_observed_at":"2026-08-09T17:35:35.604319Z","submitted_at":"2025-02-02T14:50:25Z","title":"Disentangling Length Bias In Preference Learning Via Response-Conditioned Modeling","version":2},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-09T17:46:29.124817Z"},"links":{"cited_paper":"/paper/2212.08073","citing_paper":"/paper/2502.00814"},"observation_digest":"sha256:0bf4ce4fd3f685001df92480dbc72185a6ac3ff30b8f8df5bdd761d28913d17e","observation_id":"4d39e875-6eee-42c7-b8b1-e0d907b9e23a","resolution":{"observed_at":"2026-08-09T17:46:29.124817Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T17:46:29.128796Z","title":null,"venue":null,"work_id":null,"year":1952},"citing_paper":{"arxiv_id":"2502.00814","last_updated":"2025-05-19T08:24:51Z","snapshot_observed_at":"2026-08-09T17:35:35.604319Z","submitted_at":"2025-02-02T14:50:25Z","title":"Disentangling Length Bias In Preference Learning Via Response-Conditioned Modeling","version":2},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-09T17:46:29.128796Z"},"links":{"citing_paper":"/paper/2502.00814"},"observation_digest":"sha256:28f43479ecbc386a0924320677a4662fa768a87bf34f01f8d6e2c71cc2391d26","observation_id":"b1851354-1fa4-40e3-b08d-319ce8a0f1b7","resolution":{"observed_at":"2026-08-09T17:46:29.128796Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T17:46:29.132420Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.00814","last_updated":"2025-05-19T08:24:51Z","snapshot_observed_at":"2026-08-09T17:35:35.604319Z","submitted_at":"2025-02-02T14:50:25Z","title":"Disentangling Length Bias In Preference Learning Via Response-Conditioned Modeling","version":2},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-09T17:46:29.132420Z"},"links":{"citing_paper":"/paper/2502.00814"},"observation_digest":"sha256:7c57a90faa5e6792665bcf25b153b3e7aa63ca4f0174d5473d31997cf3aaa487","observation_id":"639fa08c-a265-4ea5-8b7e-60be1ec09e59","resolution":{"observed_at":"2026-08-09T17:46:29.132420Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T17:46:29.898920Z","title":"Christoffersen, Mehul Damani, Stewart Slocum, Usman Anwar, and 13 others","venue":null,"work_id":"9af7726d-1e4b-44f5-96c1-0a3d562458a5","year":2023},"citing_paper":{"arxiv_id":"2502.00814","last_updated":"2025-05-19T08:24:51Z","snapshot_observed_at":"2026-08-09T17:35:35.604319Z","submitted_at":"2025-02-02T14:50:25Z","title":"Disentangling Length Bias In Preference Learning Via Response-Conditioned Modeling","version":2},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-09T17:46:29.136161Z"},"links":{"citing_paper":"/paper/2502.00814"},"observation_digest":"sha256:b15040ed8f39951ebdcf5119262c5c87aac5cf8da2297ef14f0d2227da0f01c1","observation_id":"895328f6-ddd7-41ce-bd66-3f7585ec7d44","resolution":{"observed_at":"2026-08-09T17:46:29.902546Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.05369","last_updated":"2024-10-30T07:29:40Z","snapshot_observed_at":"2026-08-03T15:33:34.682108Z","submitted_at":"2024-02-08T02:58:47Z","title":"Noise Contrastive Alignment of Language Models with Explicit Rewards","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.05369","snapshot_observed_at":"2026-08-09T17:46:29.139910Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.00814","last_updated":"2025-05-19T08:24:51Z","snapshot_observed_at":"2026-08-09T17:35:35.604319Z","submitted_at":"2025-02-02T14:50:25Z","title":"Disentangling Length Bias In Preference Learning Via Response-Conditioned Modeling","version":2},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-09T17:46:29.139910Z"},"links":{"cited_paper":"/paper/2402.05369","citing_paper":"/paper/2502.00814"},"observation_digest":"sha256:3b081eb76499603ef4ed8a308b07702447f849bf9cd170b394a3e01d7c3f3922","observation_id":"5e2afa0f-02b2-4f15-b42a-8db7b9025f3f","resolution":{"observed_at":"2026-08-09T17:46:29.139910Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T17:46:29.888280Z","title":null,"venue":null,"work_id":"6f4085bc-cfcf-43d8-b7ab-dea9dfdd22fb","year":2024},"citing_paper":{"arxiv_id":"2502.00814","last_updated":"2025-05-19T08:24:51Z","snapshot_observed_at":"2026-08-09T17:35:35.604319Z","submitted_at":"2025-02-02T14:50:25Z","title":"Disentangling Length Bias In Preference Learning Via Response-Conditioned Modeling","version":2},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-09T17:46:29.143706Z"},"links":{"citing_paper":"/paper/2502.00814"},"observation_digest":"sha256:db50c3c81f562611d58523222ef0356aa68aa27d9e0cae4cc36160d7781c4b69","observation_id":"b53fb7d2-d286-4eab-9a26-13e94c5e1500","resolution":{"observed_at":"2026-08-09T17:46:29.892194Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T17:46:29.147056Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.00814","last_updated":"2025-05-19T08:24:51Z","snapshot_observed_at":"2026-08-09T17:35:35.604319Z","submitted_at":"2025-02-02T14:50:25Z","title":"Disentangling Length Bias In Preference Learning Via Response-Conditioned Modeling","version":2},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-09T17:46:29.147056Z"},"links":{"citing_paper":"/paper/2502.00814"},"observation_digest":"sha256:4f51289dde7e21f236eb0e699b87464f980d32070ec654674e0478db3bdc55f4","observation_id":"90e4d899-9355-48da-9094-f0bca6d4f7ff","resolution":{"observed_at":"2026-08-09T17:46:29.147056Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-09T17:46:29.150402Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.00814","last_updated":"2025-05-19T08:24:51Z","snapshot_observed_at":"2026-08-09T17:35:35.604319Z","submitted_at":"2025-02-02T14:50:25Z","title":"Disentangling Length Bias In Preference Learning Via Response-Conditioned Modeling","version":2},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-09T17:46:29.150402Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2502.00814"},"observation_digest":"sha256:b1ba0d3524fd03472f2de80b365f248a9feeb022a1cc4ce6c5ff4506b0d61542","observation_id":"01613714-7209-4ffd-9a3b-3301336890b3","resolution":{"observed_at":"2026-08-09T17:46:29.150402Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.04475","last_updated":"2025-03-10T09:27:03Z","snapshot_observed_at":"2026-07-06T17:56:23.317089Z","submitted_at":"2024-04-06T02:29:02Z","title":"Length-Controlled AlpacaEval: A Simple Way to Debias Automatic Evaluators","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.04475","snapshot_observed_at":"2026-08-09T17:46:29.154202Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.00814","last_updated":"2025-05-19T08:24:51Z","snapshot_observed_at":"2026-08-09T17:35:35.604319Z","submitted_at":"2025-02-02T14:50:25Z","title":"Disentangling Length Bias In Preference Learning Via Response-Conditioned Modeling","version":2},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-09T17:46:29.154202Z"},"links":{"cited_paper":"/paper/2404.04475","citing_paper":"/paper/2502.00814"},"observation_digest":"sha256:8b3faab092f5d1472e78225c7fc4c3b0f904e4e7181ea4f3c3f798b3933af5f8","observation_id":"43b1f528-7d4a-43d9-a2b4-282d6622d2cb","resolution":{"observed_at":"2026-08-09T17:46:29.154202Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T17:46:29.871500Z","title":null,"venue":null,"work_id":"e008cb77-a0db-4647-a784-0e64c23adf26","year":2024},"citing_paper":{"arxiv_id":"2502.00814","last_updated":"2025-05-19T08:24:51Z","snapshot_observed_at":"2026-08-09T17:35:35.604319Z","submitted_at":"2025-02-02T14:50:25Z","title":"Disentangling Length Bias In Preference Learning Via Response-Conditioned Modeling","version":2},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-09T17:46:29.158039Z"},"links":{"citing_paper":"/paper/2502.00814"},"observation_digest":"sha256:a171e58db3b2f3d963d746018201194cfb59036db1c37c70a8e21fefc97a1138","observation_id":"8b68a731-4f52-4543-82ab-7af54c4d0614","resolution":{"observed_at":"2026-08-09T17:46:29.874901Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.01306","last_updated":"2024-11-19T18:12:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-02-02T10:53:36Z","title":"KTO: Model Alignment as Prospect Theoretic Optimization","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.01306","snapshot_observed_at":"2026-08-09T17:46:29.161466Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.00814","last_updated":"2025-05-19T08:24:51Z","snapshot_observed_at":"2026-08-09T17:35:35.604319Z","submitted_at":"2025-02-02T14:50:25Z","title":"Disentangling Length Bias In Preference Learning Via Response-Conditioned Modeling","version":2},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-09T17:46:29.161466Z"},"links":{"cited_paper":"/paper/2402.01306","citing_paper":"/paper/2502.00814"},"observation_digest":"sha256:adf22016fa9f241325bc4801da657e6b384a41f293b6700b02c7f14e7b6d4aac","observation_id":"e9650ee8-d8bd-418b-aa70-d80e0581fa81","resolution":{"observed_at":"2026-08-09T17:46:29.161466Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T17:46:29.165055Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.00814","last_updated":"2025-05-19T08:24:51Z","snapshot_observed_at":"2026-08-09T17:35:35.604319Z","submitted_at":"2025-02-02T14:50:25Z","title":"Disentangling Length Bias In Preference Learning Via Response-Conditioned Modeling","version":2},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-09T17:46:29.165055Z"},"links":{"citing_paper":"/paper/2502.00814"},"observation_digest":"sha256:f52c6c7f564530acc6278e31c8184e73ccdca5de589e8f372eed2079e7524f41","observation_id":"32ba3a61-ea14-4c2d-a423-e7d232e4e000","resolution":{"observed_at":"2026-08-09T17:46:29.165055Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T17:46:29.168467Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.00814","last_updated":"2025-05-19T08:24:51Z","snapshot_observed_at":"2026-08-09T17:35:35.604319Z","submitted_at":"2025-02-02T14:50:25Z","title":"Disentangling Length Bias In Preference Learning Via Response-Conditioned Modeling","version":2},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-09T17:46:29.168467Z"},"links":{"citing_paper":"/paper/2502.00814"},"observation_digest":"sha256:ecf7e3b5bec0b0f38630dd2c919c7359a02ddfaaa0dd580707b496d88f16a7b1","observation_id":"48bd23ca-8018-44b6-bd0e-0f42d18fcf4d","resolution":{"observed_at":"2026-08-09T17:46:29.168467Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T17:46:29.171987Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.00814","last_updated":"2025-05-19T08:24:51Z","snapshot_observed_at":"2026-08-09T17:35:35.604319Z","submitted_at":"2025-02-02T14:50:25Z","title":"Disentangling Length Bias In Preference Learning Via Response-Conditioned Modeling","version":2},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-09T17:46:29.171987Z"},"links":{"citing_paper":"/paper/2502.00814"},"observation_digest":"sha256:8cb5f18b426cf252292fe4d704014ca3fd6f094719e0de3b9c6093bb6524cb02","observation_id":"f6f09260-d306-4ede-8fe5-6f7ccad15201","resolution":{"observed_at":"2026-08-09T17:46:29.171987Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T17:46:29.175463Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.00814","last_updated":"2025-05-19T08:24:51Z","snapshot_observed_at":"2026-08-09T17:35:35.604319Z","submitted_at":"2025-02-02T14:50:25Z","title":"Disentangling Length Bias In Preference Learning Via Response-Conditioned Modeling","version":2},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-09T17:46:29.175463Z"},"links":{"citing_paper":"/paper/2502.00814"},"observation_digest":"sha256:0348fbc5b367ab2832ac722dadcad7f0ece481810ba2f0247bfab953c0684cc5","observation_id":"a113081c-5738-4ae5-b925-73739651f750","resolution":{"observed_at":"2026-08-09T17:46:29.175463Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21276","last_updated":"2024-10-25T17:43:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-25T17:43:01Z","title":"GPT-4o System Card","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.21276","snapshot_observed_at":"2026-08-09T17:46:29.178757Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.00814","last_updated":"2025-05-19T08:24:51Z","snapshot_observed_at":"2026-08-09T17:35:35.604319Z","submitted_at":"2025-02-02T14:50:25Z","title":"Disentangling Length Bias In Preference Learning Via Response-Conditioned Modeling","version":2},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-09T17:46:29.178757Z"},"links":{"cited_paper":"/paper/2410.21276","citing_paper":"/paper/2502.00814"},"observation_digest":"sha256:6e6609e3e9b64b397f795c151caeddc56ce54d9a79fd4e6d4cdef0dadc652663","observation_id":"b9fa1fa6-77fe-4932-b1a5-42ca979a86ca","resolution":{"observed_at":"2026-08-09T17:46:29.178757Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T17:46:29.847454Z","title":null,"venue":null,"work_id":"671ba2c9-7fc0-4f1f-aeb7-b58ee38dce66","year":2023},"citing_paper":{"arxiv_id":"2502.00814","last_updated":"2025-05-19T08:24:51Z","snapshot_observed_at":"2026-08-09T17:35:35.604319Z","submitted_at":"2025-02-02T14:50:25Z","title":"Disentangling Length Bias In Preference Learning Via Response-Conditioned Modeling","version":2},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-09T17:46:29.182500Z"},"links":{"citing_paper":"/paper/2502.00814"},"observation_digest":"sha256:c54f3bf3f62d28d9e53c758a02d9f6392402b45c01a84edf196087c003f30b48","observation_id":"93666958-02ac-4f04-aad1-5e24a011bbba","resolution":{"observed_at":"2026-08-09T17:46:29.851094Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T17:46:29.835986Z","title":"Smith, Yejin Choi, and Hannaneh Hajishirzi","venue":null,"work_id":"fc997141-c754-4ba3-b220-780535350d10","year":2024},"citing_paper":{"arxiv_id":"2502.00814","last_updated":"2025-05-19T08:24:51Z","snapshot_observed_at":"2026-08-09T17:35:35.604319Z","submitted_at":"2025-02-02T14:50:25Z","title":"Disentangling Length Bias In Preference Learning Via Response-Conditioned Modeling","version":2},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-09T17:46:29.185744Z"},"links":{"citing_paper":"/paper/2502.00814"},"observation_digest":"sha256:a92c82e35d31e27794c57e799659821da9534d8c911afea011e77325eaa88158","observation_id":"8189cc2d-8c2e-48a8-a87d-38025becc9b4","resolution":{"observed_at":"2026-08-09T17:46:29.840025Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T17:46:29.824971Z","title":null,"venue":null,"work_id":"3225c6b1-da3c-4308-8671-078ccfd03f90","year":2023},"citing_paper":{"arxiv_id":"2502.00814","last_updated":"2025-05-19T08:24:51Z","snapshot_observed_at":"2026-08-09T17:35:35.604319Z","submitted_at":"2025-02-02T14:50:25Z","title":"Disentangling Length Bias In Preference Learning Via Response-Conditioned Modeling","version":2},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-09T17:46:29.190322Z"},"links":{"citing_paper":"/paper/2502.00814"},"observation_digest":"sha256:0a174785c7ec3451723f2079b2ef3ec1ed8e1b359a3393cc19e11b00d7ca5dfe","observation_id":"6f5e6ebf-4922-4756-ba64-7020c4f606e1","resolution":{"observed_at":"2026-08-09T17:46:29.828400Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T17:46:29.193590Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.00814","last_updated":"2025-05-19T08:24:51Z","snapshot_observed_at":"2026-08-09T17:35:35.604319Z","submitted_at":"2025-02-02T14:50:25Z","title":"Disentangling Length Bias In Preference Learning Via Response-Conditioned Modeling","version":2},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-09T17:46:29.193590Z"},"links":{"citing_paper":"/paper/2502.00814"},"observation_digest":"sha256:0a8cd70c3751d90ddc404164271f0d5201bdbee82b2534762b7051f713bec097","observation_id":"8781ca82-6335-4fac-8dfc-b7b335b52a1c","resolution":{"observed_at":"2026-08-09T17:46:29.193590Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T17:46:29.814363Z","title":"o pf, Yannic Kilcher, Dimitri von R \\","venue":null,"work_id":"3cfd2ccd-5a2f-4cfc-acce-15859d356fc1","year":2024},"citing_paper":{"arxiv_id":"2502.00814","last_updated":"2025-05-19T08:24:51Z","snapshot_observed_at":"2026-08-09T17:35:35.604319Z","submitted_at":"2025-02-02T14:50:25Z","title":"Disentangling Length Bias In Preference Learning Via Response-Conditioned Modeling","version":2},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-09T17:46:29.196927Z"},"links":{"citing_paper":"/paper/2502.00814"},"observation_digest":"sha256:699884593fcd40a372fb9ceff52ff77c334ca1a3d5c0463ab379030987549b24","observation_id":"bfd90ed0-67ab-4ecf-a737-3d6991d3750e","resolution":{"observed_at":"2026-08-09T17:46:29.818069Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T17:46:29.200234Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2502.00814","last_updated":"2025-05-19T08:24:51Z","snapshot_observed_at":"2026-08-09T17:35:35.604319Z","submitted_at":"2025-02-02T14:50:25Z","title":"Disentangling Length Bias In Preference Learning Via Response-Conditioned Modeling","version":2},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-09T17:46:29.200234Z"},"links":{"citing_paper":"/paper/2502.00814"},"observation_digest":"sha256:834b78710350aaa3b55ab1b08f17c9baebfd092ff2c79871b591f2fba87d06fe","observation_id":"c6244b72-6611-425a-9530-51d8f06b9be6","resolution":{"observed_at":"2026-08-09T17:46:29.200234Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T17:46:29.804383Z","title":null,"venue":null,"work_id":"22d5cb6d-ca55-4a6b-997a-3185b8f62551","year":2019},"citing_paper":{"arxiv_id":"2502.00814","last_updated":"2025-05-19T08:24:51Z","snapshot_observed_at":"2026-08-09T17:35:35.604319Z","submitted_at":"2025-02-02T14:50:25Z","title":"Disentangling Length Bias In Preference Learning Via Response-Conditioned Modeling","version":2},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-09T17:46:29.203615Z"},"links":{"citing_paper":"/paper/2502.00814"},"observation_digest":"sha256:c347f3f70c0dea393cf126b93f1fbfde3c64af11095d31896d07cb6d3e758aa8","observation_id":"d995181b-647d-4fa4-aa1f-7ba9fa2467c6","resolution":{"observed_at":"2026-08-09T17:46:29.807852Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.00168","last_updated":"2024-02-02T03:41:50Z","snapshot_observed_at":"2026-07-06T16:41:27.099792Z","submitted_at":"2023-10-31T21:52:41Z","title":"The Alignment Ceiling: Objective Mismatch in Reinforcement Learning from Human Feedback","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.00168","snapshot_observed_at":"2026-08-09T17:46:29.206702Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.00814","last_updated":"2025-05-19T08:24:51Z","snapshot_observed_at":"2026-08-09T17:35:35.604319Z","submitted_at":"2025-02-02T14:50:25Z","title":"Disentangling Length Bias In Preference Learning Via Response-Conditioned Modeling","version":2},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-09T17:46:29.206702Z"},"links":{"cited_paper":"/paper/2311.00168","citing_paper":"/paper/2502.00814"},"observation_digest":"sha256:076c77fec74798dd76c4855866bd7860f6d8ae754e52644fb90ab25e2fab08d0","observation_id":"18fe0b8c-1553-4484-875b-0d72e477049e","resolution":{"observed_at":"2026-08-09T17:46:29.206702Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.13787","last_updated":"2024-06-08T16:40:12Z","snapshot_observed_at":"2026-08-02T18:11:57.036767Z","submitted_at":"2024-03-20T17:49:54Z","title":"RewardBench: Evaluating Reward Models for Language Modeling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.13787","snapshot_observed_at":"2026-08-09T17:46:29.210313Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.00814","last_updated":"2025-05-19T08:24:51Z","snapshot_observed_at":"2026-08-09T17:35:35.604319Z","submitted_at":"2025-02-02T14:50:25Z","title":"Disentangling Length Bias In Preference Learning Via Response-Conditioned Modeling","version":2},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-09T17:46:29.210313Z"},"links":{"cited_paper":"/paper/2403.13787","citing_paper":"/paper/2502.00814"},"observation_digest":"sha256:ab83beeadb81c0c527ad8f905f221e3ef1447df32c79d59c2c7c375224f0918e","observation_id":"9c49e95d-6763-498a-b9ae-8338a9fdac8a","resolution":{"observed_at":"2026-08-09T17:46:29.210313Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.00267","last_updated":"2024-09-03T14:01:54Z","snapshot_observed_at":"2026-07-06T16:13:07.384791Z","submitted_at":"2023-09-01T05:53:33Z","title":"RLAIF vs. RLHF: Scaling Reinforcement Learning from Human Feedback with AI Feedback","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.00267","snapshot_observed_at":"2026-08-09T17:46:29.213913Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.00814","last_updated":"2025-05-19T08:24:51Z","snapshot_observed_at":"2026-08-09T17:35:35.604319Z","submitted_at":"2025-02-02T14:50:25Z","title":"Disentangling Length Bias In Preference Learning Via Response-Conditioned Modeling","version":2},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-09T17:46:29.213913Z"},"links":{"cited_paper":"/paper/2309.00267","citing_paper":"/paper/2502.00814"},"observation_digest":"sha256:500310134b526ff1e669c9ea3cf689140518caeb38e164ea10a183d537ece5ef","observation_id":"deed4d9b-04f2-4c85-aaf5-3b5df0d3df2c","resolution":{"observed_at":"2026-08-09T17:46:29.213913Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T17:46:29.793618Z","title":null,"venue":null,"work_id":"de0fd22f-bf50-4990-bd61-58916887d67c","year":2020},"citing_paper":{"arxiv_id":"2502.00814","last_updated":"2025-05-19T08:24:51Z","snapshot_observed_at":"2026-08-09T17:35:35.604319Z","submitted_at":"2025-02-02T14:50:25Z","title":"Disentangling Length Bias In Preference Learning Via Response-Conditioned Modeling","version":2},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-09T17:46:29.217524Z"},"links":{"citing_paper":"/paper/2502.00814"},"observation_digest":"sha256:883a70f26cc5236ee2337e648e4bd892c9c3f818117be4573ce4b98ec41babc4","observation_id":"93579785-6e5e-480c-98ef-d69d6e2fc840","resolution":{"observed_at":"2026-08-09T17:46:29.797693Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.08656","last_updated":"2025-02-23T03:39:12Z","snapshot_observed_at":"2026-07-06T19:01:27.827878Z","submitted_at":"2024-08-16T10:45:45Z","title":"LLMs Are Biased Towards Output Formats! Systematically Evaluating and Mitigating Output Format Bias of LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.08656","snapshot_observed_at":"2026-08-09T17:46:29.220861Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.00814","last_updated":"2025-05-19T08:24:51Z","snapshot_observed_at":"2026-08-09T17:35:35.604319Z","submitted_at":"2025-02-02T14:50:25Z","title":"Disentangling Length Bias In Preference Learning Via Response-Conditioned Modeling","version":2},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-09T17:46:29.220861Z"},"links":{"cited_paper":"/paper/2408.08656","citing_paper":"/paper/2502.00814"},"observation_digest":"sha256:f0ecc7f187147f938188bbc98468552fa5c9bf08f5944a911bdd7032a287cec0","observation_id":"f75e4305-dbf3-4c81-9146-00684ed25f74","resolution":{"observed_at":"2026-08-09T17:46:29.220861Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.09583","last_updated":"2025-06-04T08:58:56Z","snapshot_observed_at":"2026-08-02T06:48:43.121988Z","submitted_at":"2023-08-18T14:23:21Z","title":"WizardMath: Empowering Mathematical Reasoning for Large Language Models via Reinforced Evol-Instruct","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.09583","snapshot_observed_at":"2026-08-09T17:46:29.224467Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.00814","last_updated":"2025-05-19T08:24:51Z","snapshot_observed_at":"2026-08-09T17:35:35.604319Z","submitted_at":"2025-02-02T14:50:25Z","title":"Disentangling Length Bias In Preference Learning Via Response-Conditioned Modeling","version":2},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-09T17:46:29.224467Z"},"links":{"cited_paper":"/paper/2308.09583","citing_paper":"/paper/2502.00814"},"observation_digest":"sha256:efcafd53b8f317166ff4908d68c2fd988f6d8e5f3280a5cf867711d4489c9316","observation_id":"86bd11ef-ef1d-460a-9c8a-e014d7947641","resolution":{"observed_at":"2026-08-09T17:46:29.224467Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T17:46:29.228268Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.00814","last_updated":"2025-05-19T08:24:51Z","snapshot_observed_at":"2026-08-09T17:35:35.604319Z","submitted_at":"2025-02-02T14:50:25Z","title":"Disentangling Length Bias In Preference Learning Via Response-Conditioned Modeling","version":2},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-09T17:46:29.228268Z"},"links":{"citing_paper":"/paper/2502.00814"},"observation_digest":"sha256:67d5bab2536023cadc5b6041be429bc01cb57b18770281b06c6b81671db14627","observation_id":"16dc55fe-fe52-4719-84a2-43320d48ddf1","resolution":{"observed_at":"2026-08-09T17:46:29.228268Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T17:46:29.776658Z","title":null,"venue":null,"work_id":"e003daed-76d6-40d4-b9c7-6e62419fc75d","year":2022},"citing_paper":{"arxiv_id":"2502.00814","last_updated":"2025-05-19T08:24:51Z","snapshot_observed_at":"2026-08-09T17:35:35.604319Z","submitted_at":"2025-02-02T14:50:25Z","title":"Disentangling Length Bias In Preference Learning Via Response-Conditioned Modeling","version":2},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-09T17:46:29.231882Z"},"links":{"citing_paper":"/paper/2502.00814"},"observation_digest":"sha256:bb4ecbf5617b34eba8346d61b649e75d2ae89f9704fbdf4ce54a339a26237e36","observation_id":"132237d9-77a9-4f51-8cea-c6efd0fd23e7","resolution":{"observed_at":"2026-08-09T17:46:29.780132Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.19159","last_updated":"2024-09-09T04:39:31Z","snapshot_observed_at":"2026-08-08T10:19:27.268855Z","submitted_at":"2024-03-28T06:03:47Z","title":"Disentangling Length from Quality in Direct Preference Optimization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.19159","snapshot_observed_at":"2026-08-09T17:46:29.235461Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.00814","last_updated":"2025-05-19T08:24:51Z","snapshot_observed_at":"2026-08-09T17:35:35.604319Z","submitted_at":"2025-02-02T14:50:25Z","title":"Disentangling Length Bias In Preference Learning Via Response-Conditioned Modeling","version":2},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-09T17:46:29.235461Z"},"links":{"cited_paper":"/paper/2403.19159","citing_paper":"/paper/2502.00814"},"observation_digest":"sha256:433ddf6ec1a3faba2dcf8e5e9f27d899d79b8747f2f9fe7a160577d50da96929","observation_id":"5bb56b2a-80fe-4d09-bf07-d307e47eea2f","resolution":{"observed_at":"2026-08-09T17:46:29.235461Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T17:46:29.242728Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.00814","last_updated":"2025-05-19T08:24:51Z","snapshot_observed_at":"2026-08-09T17:35:35.604319Z","submitted_at":"2025-02-02T14:50:25Z","title":"Disentangling Length Bias In Preference Learning Via Response-Conditioned Modeling","version":2},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-09T17:46:29.242728Z"},"links":{"citing_paper":"/paper/2502.00814"},"observation_digest":"sha256:eb6ec7f1a60cfd5467144928fa65948afdf5c7653e7a9bd7a5b6e82eab3c3c15","observation_id":"e1da4260-4dd8-41f0-beab-a4499c2decb1","resolution":{"observed_at":"2026-08-09T17:46:29.242728Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T17:46:29.246805Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.00814","last_updated":"2025-05-19T08:24:51Z","snapshot_observed_at":"2026-08-09T17:35:35.604319Z","submitted_at":"2025-02-02T14:50:25Z","title":"Disentangling Length Bias In Preference Learning Via Response-Conditioned Modeling","version":2},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-09T17:46:29.246805Z"},"links":{"citing_paper":"/paper/2502.00814"},"observation_digest":"sha256:ef1feb43f9e5ae951831b5987c1d62b4e66cdef4ac1f37aa310f876add3b9875","observation_id":"74ed2454-363a-430c-b1c0-d2f248191382","resolution":{"observed_at":"2026-08-09T17:46:29.246805Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T17:46:29.759627Z","title":null,"venue":null,"work_id":"a7f09995-f92f-4afa-95f3-b5d3b21d2451","year":2021},"citing_paper":{"arxiv_id":"2502.00814","last_updated":"2025-05-19T08:24:51Z","snapshot_observed_at":"2026-08-09T17:35:35.604319Z","submitted_at":"2025-02-02T14:50:25Z","title":"Disentangling Length Bias In Preference Learning Via Response-Conditioned Modeling","version":2},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-09T17:46:29.250319Z"},"links":{"citing_paper":"/paper/2502.00814"},"observation_digest":"sha256:6e83d0cff834d155abad66eb24fb7e4e8eb85edcbec17cb01659ec3c1a6e71b0","observation_id":"988612c6-fb9c-4508-8a18-3d04be348795","resolution":{"observed_at":"2026-08-09T17:46:29.762929Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T17:46:29.253981Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.00814","last_updated":"2025-05-19T08:24:51Z","snapshot_observed_at":"2026-08-09T17:35:35.604319Z","submitted_at":"2025-02-02T14:50:25Z","title":"Disentangling Length Bias In Preference Learning Via Response-Conditioned Modeling","version":2},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-09T17:46:29.253981Z"},"links":{"citing_paper":"/paper/2502.00814"},"observation_digest":"sha256:6cd0fe649f68b4f3f6d933a3b0d69f40040599391889ce2371665a62467f5605","observation_id":"ff9b348c-7716-48ce-b735-f284b88385fd","resolution":{"observed_at":"2026-08-09T17:46:29.253981Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.12187","last_updated":"2024-01-22T18:27:08Z","snapshot_observed_at":"2026-07-30T18:16:51.527587Z","submitted_at":"2024-01-22T18:27:08Z","title":"WARM: On the Benefits of Weight Averaged Reward Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.12187","snapshot_observed_at":"2026-08-09T17:46:29.257425Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.00814","last_updated":"2025-05-19T08:24:51Z","snapshot_observed_at":"2026-08-09T17:35:35.604319Z","submitted_at":"2025-02-02T14:50:25Z","title":"Disentangling Length Bias In Preference Learning Via Response-Conditioned Modeling","version":2},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-09T17:46:29.257425Z"},"links":{"cited_paper":"/paper/2401.12187","citing_paper":"/paper/2502.00814"},"observation_digest":"sha256:8f426bbb744c22815bd883c8309675d71ac567ba2c4a5eca62f1a85820700136","observation_id":"cd98b722-028c-4980-8079-1ceae83db87f","resolution":{"observed_at":"2026-08-09T17:46:29.257425Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-09T17:46:29.260970Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2502.00814","last_updated":"2025-05-19T08:24:51Z","snapshot_observed_at":"2026-08-09T17:35:35.604319Z","submitted_at":"2025-02-02T14:50:25Z","title":"Disentangling Length Bias In Preference Learning Via Response-Conditioned Modeling","version":2},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-09T17:46:29.260970Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2502.00814"},"observation_digest":"sha256:cc9023ff723dbd3fa856abf3f6edd27cbbaa18a2b494be427c3647a23d9d7533","observation_id":"372f1231-5464-4e35-a624-9d8cdafa3132","resolution":{"observed_at":"2026-08-09T17:46:29.260970Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.05199","last_updated":"2023-11-29T14:45:53Z","snapshot_observed_at":"2026-07-06T16:29:27.783330Z","submitted_at":"2023-10-08T15:14:39Z","title":"Loose lips sink ships: Mitigating Length Bias in Reinforcement Learning from Human Feedback","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.05199","snapshot_observed_at":"2026-08-09T17:46:29.264777Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.00814","last_updated":"2025-05-19T08:24:51Z","snapshot_observed_at":"2026-08-09T17:35:35.604319Z","submitted_at":"2025-02-02T14:50:25Z","title":"Disentangling Length Bias In Preference Learning Via Response-Conditioned Modeling","version":2},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-09T17:46:29.264777Z"},"links":{"cited_paper":"/paper/2310.05199","citing_paper":"/paper/2502.00814"},"observation_digest":"sha256:6174ed1a75db8bcc0f9be453e05d4bc0ddc72e650949e94ae9097bc21d7a892b","observation_id":"28f7d9d3-3b58-4538-a665-abd9caa2bc19","resolution":{"observed_at":"2026-08-09T17:46:29.264777Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T17:46:29.742725Z","title":null,"venue":null,"work_id":"e98338bc-863f-4242-ad01-81f6f553737f","year":1993},"citing_paper":{"arxiv_id":"2502.00814","last_updated":"2025-05-19T08:24:51Z","snapshot_observed_at":"2026-08-09T17:35:35.604319Z","submitted_at":"2025-02-02T14:50:25Z","title":"Disentangling Length Bias In Preference Learning Via Response-Conditioned Modeling","version":2},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-09T17:46:29.268272Z"},"links":{"citing_paper":"/paper/2502.00814"},"observation_digest":"sha256:ec66b60c513f53db86112472d83788d69f6755dcf946dab034ba55351968accf","observation_id":"20d7361c-5354-4e99-83d3-a0503e86928a","resolution":{"observed_at":"2026-08-09T17:46:29.746397Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.03716","last_updated":"2024-07-10T23:15:49Z","snapshot_observed_at":"2026-08-03T14:09:43.107865Z","submitted_at":"2023-10-05T17:38:28Z","title":"A Long Way to Go: Investigating Length Correlations in RLHF","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.03716","snapshot_observed_at":"2026-08-09T17:46:29.272056Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.00814","last_updated":"2025-05-19T08:24:51Z","snapshot_observed_at":"2026-08-09T17:35:35.604319Z","submitted_at":"2025-02-02T14:50:25Z","title":"Disentangling Length Bias In Preference Learning Via Response-Conditioned Modeling","version":2},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-09T17:46:29.272056Z"},"links":{"cited_paper":"/paper/2310.03716","citing_paper":"/paper/2502.00814"},"observation_digest":"sha256:6e345d1c0e10a7bae360ea6e45103234875be5f603bd9da861110b2334d044e7","observation_id":"5e01346b-9df2-4ca3-b2cd-0c293fc45593","resolution":{"observed_at":"2026-08-09T17:46:29.272056Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T17:46:29.731989Z","title":null,"venue":null,"work_id":"fae03e1a-c82d-48fc-93ed-143abf485cc6","year":2022},"citing_paper":{"arxiv_id":"2502.00814","last_updated":"2025-05-19T08:24:51Z","snapshot_observed_at":"2026-08-09T17:35:35.604319Z","submitted_at":"2025-02-02T14:50:25Z","title":"Disentangling Length Bias In Preference Learning Via Response-Conditioned Modeling","version":2},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-09T17:46:29.275748Z"},"links":{"citing_paper":"/paper/2502.00814"},"observation_digest":"sha256:a5a66e96aeb38acf45c8a239a0d58256077c6b999c6d1b0ed4af482ced278c1f","observation_id":"1566380e-2250-4489-8b79-5214692ccddc","resolution":{"observed_at":"2026-08-09T17:46:29.735480Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T17:46:29.278935Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2502.00814","last_updated":"2025-05-19T08:24:51Z","snapshot_observed_at":"2026-08-09T17:35:35.604319Z","submitted_at":"2025-02-02T14:50:25Z","title":"Disentangling Length Bias In Preference Learning Via Response-Conditioned Modeling","version":2},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-09T17:46:29.278935Z"},"links":{"citing_paper":"/paper/2502.00814"},"observation_digest":"sha256:2336787338b55d454e2189dcfd35c10ff13525acd826367aab1c379d4eebb713","observation_id":"51a0f741-798b-4b3a-aec1-31155760caea","resolution":{"observed_at":"2026-08-09T17:46:29.278935Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11805","last_updated":"2025-05-09T21:04:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-19T02:39:27Z","title":"Gemini: A Family of Highly Capable Multimodal Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.11805","snapshot_observed_at":"2026-08-09T17:46:29.282181Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.00814","last_updated":"2025-05-19T08:24:51Z","snapshot_observed_at":"2026-08-09T17:35:35.604319Z","submitted_at":"2025-02-02T14:50:25Z","title":"Disentangling Length Bias In Preference Learning Via Response-Conditioned Modeling","version":2},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-09T17:46:29.282181Z"},"links":{"cited_paper":"/paper/2312.11805","citing_paper":"/paper/2502.00814"},"observation_digest":"sha256:a7a76963ae54379e7b368fc788b691c1aa94b0246c38f5f2613d8def1086f3cf","observation_id":"a6c63ca5-29e6-45f7-be52-9c311174f437","resolution":{"observed_at":"2026-08-09T17:46:29.282181Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T17:46:29.285926Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2502.00814","last_updated":"2025-05-19T08:24:51Z","snapshot_observed_at":"2026-08-09T17:35:35.604319Z","submitted_at":"2025-02-02T14:50:25Z","title":"Disentangling Length Bias In Preference Learning Via Response-Conditioned Modeling","version":2},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-09T17:46:29.285926Z"},"links":{"citing_paper":"/paper/2502.00814"},"observation_digest":"sha256:b11d4396a1750d67ce9a5aa359208b5725f181a421648a78f46879e225b678c0","observation_id":"9f4e3dc2-949e-4e33-a572-987686e0971a","resolution":{"observed_at":"2026-08-09T17:46:29.285926Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.08417","last_updated":"2024-06-03T01:28:06Z","snapshot_observed_at":"2026-07-06T17:16:13.055978Z","submitted_at":"2024-01-16T15:04:51Z","title":"Contrastive Preference Optimization: Pushing the Boundaries of LLM Performance in Machine Translation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.08417","snapshot_observed_at":"2026-08-09T17:46:29.289278Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.00814","last_updated":"2025-05-19T08:24:51Z","snapshot_observed_at":"2026-08-09T17:35:35.604319Z","submitted_at":"2025-02-02T14:50:25Z","title":"Disentangling Length Bias In Preference Learning Via Response-Conditioned Modeling","version":2},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-09T17:46:29.289278Z"},"links":{"cited_paper":"/paper/2401.08417","citing_paper":"/paper/2502.00814"},"observation_digest":"sha256:fde07180e1a1dc57ff9a28bc6e61553e89edfe83cc1745fdb396b9e789fc19dd","observation_id":"59ef00cd-320d-4638-9330-b947142d06bf","resolution":{"observed_at":"2026-08-09T17:46:29.289278Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T17:46:29.707733Z","title":null,"venue":null,"work_id":"d1a30e25-32c5-4c02-85e0-bf40babc38e4","year":2024},"citing_paper":{"arxiv_id":"2502.00814","last_updated":"2025-05-19T08:24:51Z","snapshot_observed_at":"2026-08-09T17:35:35.604319Z","submitted_at":"2025-02-02T14:50:25Z","title":"Disentangling Length Bias In Preference Learning Via Response-Conditioned Modeling","version":2},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-09T17:46:29.292703Z"},"links":{"citing_paper":"/paper/2502.00814"},"observation_digest":"sha256:f5fce7e2843dafb2b3ea9bf12c91393498558b90e723df164d2d8481474eb688","observation_id":"98cbafc3-e6d1-4391-ad86-82a413e2baba","resolution":{"observed_at":"2026-08-09T17:46:29.712191Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.10671","last_updated":"2024-09-10T13:25:53Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-07-15T12:35:42Z","title":"Qwen2 Technical Report","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.10671","snapshot_observed_at":"2026-08-09T17:46:29.295841Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.00814","last_updated":"2025-05-19T08:24:51Z","snapshot_observed_at":"2026-08-09T17:35:35.604319Z","submitted_at":"2025-02-02T14:50:25Z","title":"Disentangling Length Bias In Preference Learning Via Response-Conditioned Modeling","version":2},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-09T17:46:29.295841Z"},"links":{"cited_paper":"/paper/2407.10671","citing_paper":"/paper/2502.00814"},"observation_digest":"sha256:af1f8856a09ed9b7054135071478f2b6fc6e254ad24e0b2322f7eb92a9b28204","observation_id":"1a0f8728-8f31-4002-8b7b-e39d4c193fba","resolution":{"observed_at":"2026-08-09T17:46:29.295841Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.01320","last_updated":"2023-08-02T18:49:57Z","snapshot_observed_at":"2026-07-06T16:01:45.794350Z","submitted_at":"2023-08-02T18:49:57Z","title":"DeepSpeed-Chat: Easy, Fast and Affordable RLHF Training of ChatGPT-like Models at All Scales","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.01320","snapshot_observed_at":"2026-08-09T17:46:29.299748Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.00814","last_updated":"2025-05-19T08:24:51Z","snapshot_observed_at":"2026-08-09T17:35:35.604319Z","submitted_at":"2025-02-02T14:50:25Z","title":"Disentangling Length Bias In Preference Learning Via Response-Conditioned Modeling","version":2},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-09T17:46:29.299748Z"},"links":{"cited_paper":"/paper/2308.01320","citing_paper":"/paper/2502.00814"},"observation_digest":"sha256:998f35ee0b9786810db681b0bcbef52447d8c0e3aaf18511c6d87e132d934220","observation_id":"ae705c90-d7b1-4065-86eb-f4a8027ba4af","resolution":{"observed_at":"2026-08-09T17:46:29.299748Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.17744","last_updated":"2024-06-25T17:29:52Z","snapshot_observed_at":"2026-07-06T18:36:51.761148Z","submitted_at":"2024-06-25T17:29:52Z","title":"Following Length Constraints in Instructions","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.17744","snapshot_observed_at":"2026-08-09T17:46:29.303481Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.00814","last_updated":"2025-05-19T08:24:51Z","snapshot_observed_at":"2026-08-09T17:35:35.604319Z","submitted_at":"2025-02-02T14:50:25Z","title":"Disentangling Length Bias In Preference Learning Via Response-Conditioned Modeling","version":2},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-09T17:46:29.303481Z"},"links":{"cited_paper":"/paper/2406.17744","citing_paper":"/paper/2502.00814"},"observation_digest":"sha256:fcc9cb2d0cc96c6fc8f90c8ed056b90c16fba3ac14b8eb2461aa07c02898883b","observation_id":"671d4dca-2f6d-4b70-9a05-76c3579da0d1","resolution":{"observed_at":"2026-08-09T17:46:29.303481Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T17:46:29.307123Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.00814","last_updated":"2025-05-19T08:24:51Z","snapshot_observed_at":"2026-08-09T17:35:35.604319Z","submitted_at":"2025-02-02T14:50:25Z","title":"Disentangling Length Bias In Preference Learning Via Response-Conditioned Modeling","version":2},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-09T17:46:29.307123Z"},"links":{"citing_paper":"/paper/2502.00814"},"observation_digest":"sha256:c1c8e5374882cdf3cc0f899f394541735df55fdb203648d36626b3c44f1d93c9","observation_id":"83b96025-ddea-4fdc-8cb8-39c29ce3ccd9","resolution":{"observed_at":"2026-08-09T17:46:29.307123Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T17:46:29.310451Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.00814","last_updated":"2025-05-19T08:24:51Z","snapshot_observed_at":"2026-08-09T17:35:35.604319Z","submitted_at":"2025-02-02T14:50:25Z","title":"Disentangling Length Bias In Preference Learning Via Response-Conditioned Modeling","version":2},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-09T17:46:29.310451Z"},"links":{"citing_paper":"/paper/2502.00814"},"observation_digest":"sha256:3087fce14e78ac64eb6a5106544654203326943da184e79eaa6d0d639960944f","observation_id":"2c349acb-28db-4358-b755-102c3c8626a4","resolution":{"observed_at":"2026-08-09T17:46:29.310451Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1909.08593","last_updated":"2020-01-08T23:02:36Z","snapshot_observed_at":"2026-08-08T07:44:49.921146Z","submitted_at":"2019-09-18T17:33:39Z","title":"Fine-Tuning Language Models from Human Preferences","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1909.08593","snapshot_observed_at":"2026-08-09T17:46:29.313959Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2502.00814","last_updated":"2025-05-19T08:24:51Z","snapshot_observed_at":"2026-08-09T17:35:35.604319Z","submitted_at":"2025-02-02T14:50:25Z","title":"Disentangling Length Bias In Preference Learning Via Response-Conditioned Modeling","version":2},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-09T17:46:29.313959Z"},"links":{"cited_paper":"/paper/1909.08593","citing_paper":"/paper/2502.00814"},"observation_digest":"sha256:35c9616eebc78f6a374be7208e1d8c6658a6f10619131e24cd265427f1e4fbb7","observation_id":"37292ebc-18f4-4ea9-91dd-c8adcabab1c6","resolution":{"observed_at":"2026-08-09T17:46:29.313959Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T17:46:29.317766Z","title":"online\" 'onlinestring :=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.00814","last_updated":"2025-05-19T08:24:51Z","snapshot_observed_at":"2026-08-09T17:35:35.604319Z","submitted_at":"2025-02-02T14:50:25Z","title":"Disentangling Length Bias In Preference Learning Via Response-Conditioned Modeling","version":2},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-09T17:46:29.317766Z"},"links":{"citing_paper":"/paper/2502.00814"},"observation_digest":"sha256:0cae5bc054ce763cd4f70e86d174913e5aada2f89e2278018b4fda9c3b620056","observation_id":"34222efa-989c-4f61-ab43-5acd0b07059e","resolution":{"observed_at":"2026-08-09T17:46:29.317766Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T17:46:29.322067Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.00814","last_updated":"2025-05-19T08:24:51Z","snapshot_observed_at":"2026-08-09T17:35:35.604319Z","submitted_at":"2025-02-02T14:50:25Z","title":"Disentangling Length Bias In Preference Learning Via Response-Conditioned Modeling","version":2},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-09T17:46:29.322067Z"},"links":{"citing_paper":"/paper/2502.00814"},"observation_digest":"sha256:46395fdfd81189d14be570a8ef7b164d90b2d69b6cb47c5582d8dfb93b8c1189","observation_id":"5f722cb3-3e73-4e09-abb8-92656311dea5","resolution":{"observed_at":"2026-08-09T17:46:29.322067Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2502.00814","last_updated":"2025-05-19T08:24:51Z","latest_version":2,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-09T17:35:35.604319Z","submitted_at":"2025-02-02T14:50:25Z","title":"Disentangling Length Bias In Preference Learning Via Response-Conditioned Modeling"},"reference_resolution":{"displayed":57,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":54,"verified_exact":0,"verified_fuzzy":3},"total_outbound_references":57},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 57 of 57 outbound references and 3 inbound Pith citation observations for arXiv:2502.00814."}