{"as_of":"2026-08-14T15:11:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:50d63f37c1eedd1261615c16491fdac17cca41600be2aa8a286e2f7f55379759","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":18,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":18,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-14T06:32:32.682623+00:00","state":"measured"},{"denominator":18,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":18,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T00:41:10.519286Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"arxiv_reference","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":3,"observed_at":"2026-08-05T02:28:24.338817Z","source":"arxiv_reference"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2401.12187","last_updated":"2024-01-22T18:27:08Z","snapshot_observed_at":"2026-08-13T04:37:32.169632Z","submitted_at":"2024-01-22T18:27:08Z","title":"WARM: On the Benefits of Weight Averaged Reward Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.12187","snapshot_observed_at":"2026-08-11T19:24:43.411539Z","title":"Warm: On the benefits of weight averaged reward models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.06712","last_updated":"2024-12-09T18:01:13Z","snapshot_observed_at":"2026-08-14T12:39:45.946347Z","submitted_at":"2024-12-09T18:01:13Z","title":"How to Merge Your Multimodal Models Over Time?","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-11T19:24:43.411539Z"},"links":{"cited_paper":"/paper/2401.12187","citing_paper":"/paper/2412.06712"},"observation_digest":"sha256:12f90865b5c29890eae3c234d12d29a0dd2d15572d70cf638d928805533556a1","observation_id":"b057dc0d-8de0-48b2-9089-8219d101ca8b","resolution":{"observed_at":"2026-08-11T19:24:43.411539Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.12187","last_updated":"2024-01-22T18:27:08Z","snapshot_observed_at":"2026-08-13T04:37:32.169632Z","submitted_at":"2024-01-22T18:27:08Z","title":"WARM: On the Benefits of Weight Averaged Reward Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.12187","snapshot_observed_at":"2026-08-10T19:55:50.707005Z","title":"Warm: On the benefits of weight averaged reward models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.09620","last_updated":"2025-05-29T02:21:03Z","snapshot_observed_at":"2026-08-13T04:40:45.853560Z","submitted_at":"2025-01-16T16:00:37Z","title":"Beyond Reward Hacking: Causal Rewards for Large Language Model Alignment","version":2},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-10T19:55:50.707005Z"},"links":{"cited_paper":"/paper/2401.12187","citing_paper":"/paper/2501.09620"},"observation_digest":"sha256:ee6d90555a4598fb29cc97159f5ac87e402959a2bd1fb28ddf9fc554c2aa2edf","observation_id":"0cc014de-00bb-47ba-90f6-8da9e69882ea","resolution":{"observed_at":"2026-08-10T19:55:50.707005Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.12187","last_updated":"2024-01-22T18:27:08Z","snapshot_observed_at":"2026-08-13T04:37:32.169632Z","submitted_at":"2024-01-22T18:27:08Z","title":"WARM: On the Benefits of Weight Averaged Reward Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.12187","snapshot_observed_at":"2026-08-09T17:46:29.257425Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.00814","last_updated":"2025-05-19T08:24:51Z","snapshot_observed_at":"2026-08-12T21:19:56.699829Z","submitted_at":"2025-02-02T14:50:25Z","title":"Disentangling Length Bias In Preference Learning Via Response-Conditioned Modeling","version":2},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-09T17:46:29.257425Z"},"links":{"cited_paper":"/paper/2401.12187","citing_paper":"/paper/2502.00814"},"observation_digest":"sha256:cf65440be76efb274f9977d85b284addee16e3e593b55c3a0e28db6004ef8a79","observation_id":"cd98b722-028c-4980-8079-1ceae83db87f","resolution":{"observed_at":"2026-08-09T17:46:29.257425Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.12187","last_updated":"2024-01-22T18:27:08Z","snapshot_observed_at":"2026-08-13T04:37:32.169632Z","submitted_at":"2024-01-22T18:27:08Z","title":"WARM: On the Benefits of Weight Averaged Reward Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.12187","snapshot_observed_at":"2026-08-09T11:34:57.150732Z","title":"Warm: On the bene- fits of weight averaged reward models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.02671","last_updated":"2025-02-04T19:26:28Z","snapshot_observed_at":"2026-08-12T19:27:02.778679Z","submitted_at":"2025-02-04T19:26:28Z","title":"On Teacher Hacking in Language Model Distillation","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-09T11:34:57.150732Z"},"links":{"cited_paper":"/paper/2401.12187","citing_paper":"/paper/2502.02671"},"observation_digest":"sha256:efc7ce04715db1838cfae05891dedb6698b875dd8c23f8c8d80073703f33c552","observation_id":"a9917ce7-d6d8-45b9-a5cf-cfb28070d176","resolution":{"observed_at":"2026-08-09T11:34:57.150732Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.12187","last_updated":"2024-01-22T18:27:08Z","snapshot_observed_at":"2026-08-13T04:37:32.169632Z","submitted_at":"2024-01-22T18:27:08Z","title":"WARM: On the Benefits of Weight Averaged Reward Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.12187","snapshot_observed_at":"2026-08-07T14:01:05.649860Z","title":"Warm: On the benefits of weight averaged reward models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.20556","last_updated":"2025-05-26T22:34:42Z","snapshot_observed_at":"2026-08-09T01:22:43.161220Z","submitted_at":"2025-05-26T22:34:42Z","title":"Learning a Pessimistic Reward Model in RLHF","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T14:01:05.649860Z"},"links":{"cited_paper":"/paper/2401.12187","citing_paper":"/paper/2505.20556"},"observation_digest":"sha256:9ab16ace36d9074678af087b455d80da82a02a6545517205bf50e9157a3753f2","observation_id":"a2b21913-dd8a-401e-bf9e-3fe44b655998","resolution":{"observed_at":"2026-08-07T14:01:05.649860Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.12187","last_updated":"2024-01-22T18:27:08Z","snapshot_observed_at":"2026-08-13T04:37:32.169632Z","submitted_at":"2024-01-22T18:27:08Z","title":"WARM: On the Benefits of Weight Averaged Reward Models","version":1},"cited_work":{"arxiv_id":"2401.12187","doi":"10.48550/arxiv.2401.12187","metadata_source":"arxiv_reference","pith_arxiv_id":"2401.12187","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Warm: On the benefits of weight averaged reward models","venue":"arXiv (Cornell University)","work_id":"d15eafc7-9f1a-40f6-b00f-597285fc1358","year":2024},"citing_paper":{"arxiv_id":"2507.06419","last_updated":"2026-06-04T20:44:16Z","snapshot_observed_at":"2026-08-11T09:29:02.629422Z","submitted_at":"2025-07-08T21:56:33Z","title":"Teach a Reward Model to Correct Itself: Reward Guided Adversarial Failure Discovery for Robust Reward Modeling","version":2},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-05-19T05:16:22.274580Z"},"links":{"cited_paper":"/paper/2401.12187","citing_paper":"/paper/2507.06419"},"observation_digest":"sha256:775a68f581aed5cadb686139886bc18e271bda1675a04f38a2ae98b8808b1892","observation_id":"024add06-7af1-4b65-8d0d-cbf5366dfd3d","resolution":{"observed_at":"2026-05-19T05:17:05.814125Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.12187","last_updated":"2024-01-22T18:27:08Z","snapshot_observed_at":"2026-08-13T04:37:32.169632Z","submitted_at":"2024-01-22T18:27:08Z","title":"WARM: On the Benefits of Weight Averaged Reward Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.12187","snapshot_observed_at":"2026-08-06T18:51:28.316657Z","title":"Warm: On the benefits of weight averaged reward models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.07375","last_updated":"2025-07-10T01:56:56Z","snapshot_observed_at":"2026-08-14T04:50:35.955770Z","submitted_at":"2025-07-10T01:56:56Z","title":"Bradley-Terry and Multi-Objective Reward Modeling Are Complementary","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T18:51:28.316657Z"},"links":{"cited_paper":"/paper/2401.12187","citing_paper":"/paper/2507.07375"},"observation_digest":"sha256:1c5b578ff3a990c323b09a8dc00081184bc076732b2b8d18fc32b5283ba5e955","observation_id":"608ab5de-8333-4751-8d8c-66a9fe2ffdbd","resolution":{"observed_at":"2026-08-06T18:51:28.316657Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.12187","last_updated":"2024-01-22T18:27:08Z","snapshot_observed_at":"2026-08-13T04:37:32.169632Z","submitted_at":"2024-01-22T18:27:08Z","title":"WARM: On the Benefits of Weight Averaged Reward Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.12187","snapshot_observed_at":"2026-08-06T17:48:07.178654Z","title":"Warm: On the benefits of weight averaged reward models, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.09973","last_updated":"2025-07-14T06:43:00Z","snapshot_observed_at":"2026-08-08T02:31:23.778902Z","submitted_at":"2025-07-14T06:43:00Z","title":"Tiny Reward Models","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-06T17:48:07.178654Z"},"links":{"cited_paper":"/paper/2401.12187","citing_paper":"/paper/2507.09973"},"observation_digest":"sha256:f3f102a7289d969081dafe440376c1a80fa58c4bb7261384310fc9f2fe755f2f","observation_id":"c96758dd-57fc-40a8-9c3f-1eaab651fd41","resolution":{"observed_at":"2026-08-06T17:48:07.178654Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.12187","last_updated":"2024-01-22T18:27:08Z","snapshot_observed_at":"2026-08-13T04:37:32.169632Z","submitted_at":"2024-01-22T18:27:08Z","title":"WARM: On the Benefits of Weight Averaged Reward Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.12187","snapshot_observed_at":"2026-08-06T15:36:05.446280Z","title":"WARM : On the Benefits of Weight Averaged Reward Models , 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.15507","last_updated":"2025-07-21T11:19:04Z","snapshot_observed_at":"2026-08-12T15:30:56.747233Z","submitted_at":"2025-07-21T11:19:04Z","title":"Off-Policy Corrected Reward Modeling for Reinforcement Learning from Human Feedback","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-06T15:36:05.446280Z"},"links":{"cited_paper":"/paper/2401.12187","citing_paper":"/paper/2507.15507"},"observation_digest":"sha256:0b2d56062990ec2232b3cd34fd00e744c18831dadf8da43f7b5eb7f822fdd247","observation_id":"e2c4a7cc-89a7-40d8-941d-96d86ef9ce1e","resolution":{"observed_at":"2026-08-06T15:36:05.446280Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.12187","last_updated":"2024-01-22T18:27:08Z","snapshot_observed_at":"2026-08-13T04:37:32.169632Z","submitted_at":"2024-01-22T18:27:08Z","title":"WARM: On the Benefits of Weight Averaged Reward Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.12187","snapshot_observed_at":"2026-08-06T15:40:16.470462Z","title":"Warm: On the benefits of weight averaged reward models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.15906","last_updated":"2025-07-21T12:51:29Z","snapshot_observed_at":"2026-08-12T20:05:28.764695Z","submitted_at":"2025-07-21T12:51:29Z","title":"Towards Reliable, Uncertainty-Aware Alignment","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-06T15:40:16.470462Z"},"links":{"cited_paper":"/paper/2401.12187","citing_paper":"/paper/2507.15906"},"observation_digest":"sha256:1c31aa0ed7e46c2ca5d09adc3a6dee63633eba05190b938f03f056ad1cf43ab1","observation_id":"5650bcbd-ea5c-4a08-9b87-388f4fe98063","resolution":{"observed_at":"2026-08-06T15:40:16.470462Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.12187","last_updated":"2024-01-22T18:27:08Z","snapshot_observed_at":"2026-08-13T04:37:32.169632Z","submitted_at":"2024-01-22T18:27:08Z","title":"WARM: On the Benefits of Weight Averaged Reward Models","version":1},"cited_work":{"arxiv_id":"2401.12187","doi":"10.48550/arxiv.2401.12187","metadata_source":"arxiv_reference","pith_arxiv_id":"2401.12187","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Warm: On the benefits of weight averaged reward models","venue":"arXiv (Cornell University)","work_id":"d15eafc7-9f1a-40f6-b00f-597285fc1358","year":2024},"citing_paper":{"arxiv_id":"2604.17982","last_updated":"2026-04-20T09:04:49Z","snapshot_observed_at":"2026-08-12T18:21:47.619082Z","submitted_at":"2026-04-20T09:04:49Z","title":"Mitigating Multimodal Hallucination via Phase-wise Self-reward","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-10T05:10:45.144421Z"},"links":{"cited_paper":"/paper/2401.12187","citing_paper":"/paper/2604.17982"},"observation_digest":"sha256:c24f407938c760490f7610b2c4e66d5d9857e30eca8ab3f0a1ad7e8d32016730","observation_id":"b34333c6-eb98-413a-9e3b-ea7b1f8d8977","resolution":{"observed_at":"2026-05-10T09:38:43.298125Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.12187","last_updated":"2024-01-22T18:27:08Z","snapshot_observed_at":"2026-08-13T04:37:32.169632Z","submitted_at":"2024-01-22T18:27:08Z","title":"WARM: On the Benefits of Weight Averaged Reward Models","version":1},"cited_work":{"arxiv_id":"2401.12187","doi":"10.48550/arxiv.2401.12187","metadata_source":"arxiv_reference","pith_arxiv_id":"2401.12187","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Warm: On the benefits of weight averaged reward models","venue":"arXiv (Cornell University)","work_id":"d15eafc7-9f1a-40f6-b00f-597285fc1358","year":2024},"citing_paper":{"arxiv_id":"2605.24154","last_updated":"2026-05-22T19:22:17Z","snapshot_observed_at":"2026-08-14T08:11:37.614977Z","submitted_at":"2026-05-22T19:22:17Z","title":"Palette: A Modular, Controllable, and Efficient Framework for On-demand Authorized Safety Alignment Relaxation in LLMs","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-06-30T16:03:12.728352Z"},"links":{"cited_paper":"/paper/2401.12187","citing_paper":"/paper/2605.24154"},"observation_digest":"sha256:116ce07964ceab4a28d796489a9e614e167b2c721b388bd710f380cba8a6dc56","observation_id":"4dc419e5-df9d-4ad3-ac14-335e43c02c16","resolution":{"observed_at":"2026-06-30T16:04:52.576970Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.12187","last_updated":"2024-01-22T18:27:08Z","snapshot_observed_at":"2026-08-13T04:37:32.169632Z","submitted_at":"2024-01-22T18:27:08Z","title":"WARM: On the Benefits of Weight Averaged Reward Models","version":1},"cited_work":{"arxiv_id":"2401.12187","doi":"10.48550/arxiv.2401.12187","metadata_source":"arxiv_reference","pith_arxiv_id":"2401.12187","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Warm: On the benefits of weight averaged reward models","venue":"arXiv (Cornell University)","work_id":"d15eafc7-9f1a-40f6-b00f-597285fc1358","year":2024},"citing_paper":{"arxiv_id":"2606.09043","last_updated":"2026-06-08T05:24:15Z","snapshot_observed_at":"2026-08-02T05:26:25.857871Z","submitted_at":"2026-06-08T05:24:15Z","title":"DynaCF: Mitigating Shortcut Learning in Reward Models via Dynamic Counterfactual Sensitivity","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-06-27T17:26:17.072017Z"},"links":{"cited_paper":"/paper/2401.12187","citing_paper":"/paper/2606.09043"},"observation_digest":"sha256:b61b40cdfbb63f52c1940a8a066ecc0ddc006836c82fa786d5682fbf044b9b2e","observation_id":"eb16ecb7-3933-47a1-9e97-7eaa7e4bb1dc","resolution":{"observed_at":"2026-06-27T17:31:06.966629Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.12187","last_updated":"2024-01-22T18:27:08Z","snapshot_observed_at":"2026-08-13T04:37:32.169632Z","submitted_at":"2024-01-22T18:27:08Z","title":"WARM: On the Benefits of Weight Averaged Reward Models","version":1},"cited_work":{"arxiv_id":"2401.12187","doi":"10.48550/arxiv.2401.12187","metadata_source":"arxiv_reference","pith_arxiv_id":"2401.12187","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Warm: On the benefits of weight averaged reward models","venue":"arXiv (Cornell University)","work_id":"d15eafc7-9f1a-40f6-b00f-597285fc1358","year":2024},"citing_paper":{"arxiv_id":"2606.09711","last_updated":"2026-06-08T16:32:54Z","snapshot_observed_at":"2026-07-06T23:49:03.237958Z","submitted_at":"2026-06-08T16:32:54Z","title":"Proxy Reward Internalization and Mechanistic Exploitation: A Learned Precursor to Reward Hacking and Its Generalization","version":1},"reference_index":69,"source":"arxiv_source","source_observed_at":"2026-06-27T16:26:34.918099Z"},"links":{"cited_paper":"/paper/2401.12187","citing_paper":"/paper/2606.09711"},"observation_digest":"sha256:44fa79d3446614f69a38d0ee411511c7a6019e47e22bc2bdcdea747078d52f16","observation_id":"6fc38837-3c15-43a3-bcf9-70fdafaa011f","resolution":{"observed_at":"2026-07-03T01:37:30.528193Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.12187","last_updated":"2024-01-22T18:27:08Z","snapshot_observed_at":"2026-08-13T04:37:32.169632Z","submitted_at":"2024-01-22T18:27:08Z","title":"WARM: On the Benefits of Weight Averaged Reward Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.12187","snapshot_observed_at":"2026-07-11T13:53:36.775836Z","title":"arXiv preprint arXiv:2401.12187 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04763","last_updated":"2026-07-26T14:17:18Z","snapshot_observed_at":"2026-08-02T10:24:43.977557Z","submitted_at":"2026-07-06T07:56:53Z","title":"Multi-Turn On-Policy Distillation with Prefix Replay","version":1},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-07-11T13:53:36.775836Z"},"links":{"cited_paper":"/paper/2401.12187","citing_paper":"/paper/2607.04763"},"observation_digest":"sha256:c8cb2d7874105aa6108471806fcff43634d4cdd8b0abbc4a604ec83aaf69b3c2","observation_id":"7de95927-6c1b-4e41-9256-d45d2ccd6eb2","resolution":{"observed_at":"2026-07-11T13:53:36.775836Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.12187","last_updated":"2024-01-22T18:27:08Z","snapshot_observed_at":"2026-08-13T04:37:32.169632Z","submitted_at":"2024-01-22T18:27:08Z","title":"WARM: On the Benefits of Weight Averaged Reward Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.12187","snapshot_observed_at":"2026-08-02T08:40:37.580679Z","title":"arXiv preprint arXiv:2401.12187 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04763","last_updated":"2026-07-26T14:17:18Z","snapshot_observed_at":"2026-08-02T10:24:43.977557Z","submitted_at":"2026-07-06T07:56:53Z","title":"Multi-Turn On-Policy Distillation with Prefix Replay","version":3},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-02T08:40:37.580679Z"},"links":{"cited_paper":"/paper/2401.12187","citing_paper":"/paper/2607.04763"},"observation_digest":"sha256:f7fcbc4aea682b5321d75667af7a0f7b40752c5751161c84e86a8718695c2615","observation_id":"42f096b6-45c0-42cb-8ad9-9578d5e75310","resolution":{"observed_at":"2026-08-02T08:40:37.580679Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.12187","last_updated":"2024-01-22T18:27:08Z","snapshot_observed_at":"2026-08-13T04:37:32.169632Z","submitted_at":"2024-01-22T18:27:08Z","title":"WARM: On the Benefits of Weight Averaged Reward Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.12187","snapshot_observed_at":"2026-08-03T10:57:58.293232Z","title":"Warm: On the benefits of weight averaged reward models.arXiv preprint arXiv:2401.12187, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.29246","last_updated":"2026-07-31T10:19:41Z","snapshot_observed_at":"2026-08-08T13:08:03.472254Z","submitted_at":"2026-07-31T10:19:41Z","title":"Don't Mix Rewards, Mix Policies: Policy Decomposition and Optimization for Multi-Reward RL","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-03T10:57:58.293232Z"},"links":{"cited_paper":"/paper/2401.12187","citing_paper":"/paper/2607.29246"},"observation_digest":"sha256:2089770780af7ac5dcec607b1dfa9a34c6b07c733eef1f5b00f1fa121d45fcdb","observation_id":"d164ed71-f4cc-46b1-90dc-f45e60b3ff22","resolution":{"observed_at":"2026-08-03T10:57:58.293232Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.12187","last_updated":"2024-01-22T18:27:08Z","snapshot_observed_at":"2026-08-13T04:37:32.169632Z","submitted_at":"2024-01-22T18:27:08Z","title":"WARM: On the Benefits of Weight Averaged Reward Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.12187","snapshot_observed_at":"2026-08-12T00:41:10.519286Z","title":"arXiv preprint arXiv:2401.12187 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.08002","last_updated":"2026-08-08T08:28:55Z","snapshot_observed_at":"2026-08-14T06:48:56.427109Z","submitted_at":"2026-08-08T08:28:55Z","title":"Evaluator Ensembles Under Reward Hacking: Covariance Geometry and Finite-Search Guarantees","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-12T00:41:10.519286Z"},"links":{"cited_paper":"/paper/2401.12187","citing_paper":"/paper/2608.08002"},"observation_digest":"sha256:ae55dee00ce1b298e32cab3a086b311284f0185de748d317c84951db9517935a","observation_id":"274a7b35-3326-4604-ad5d-4ad4d5a76151","resolution":{"observed_at":"2026-08-12T00:41:10.519286Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2401.12187/citation-record","integrity":"/paper/2401.12187/integrity","json":"/paper/2401.12187/citation-record.json","paper":"/paper/2401.12187"},"outbound":[],"paper":{"arxiv_id":"2401.12187","last_updated":"2024-01-22T18:27:08Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-13T04:37:32.169632Z","submitted_at":"2024-01-22T18:27:08Z","title":"WARM: On the Benefits of Weight Averaged Reward Models"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"thesis":"As of 14 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 18 inbound Pith citation observations for arXiv:2401.12187."}