{"as_of":"2026-08-17T16:54:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:f334993516aed90b63d79babcfa50ca2554fc15e0e935212c6b2ff6cb5c2b77a","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":16,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":16,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-17T06:30:58.91139+00:00","state":"measured"},{"denominator":16,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":16,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T14:57:53.839991Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T10:49:45.640428Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2406.16768","last_updated":"2024-06-24T16:24:34Z","snapshot_observed_at":"2026-08-16T13:40:04.078262Z","submitted_at":"2024-06-24T16:24:34Z","title":"WARP: On the Benefits of Weight Averaged Rewarded Policies","version":1},"cited_work":{"arxiv_id":"2406.16768","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.16768","snapshot_observed_at":"2026-07-04T10:49:45.640428Z","title":"Warp: On the benefits of weight averaged rewarded policies.arXiv preprint arXiv:2406.16768, 2024","venue":null,"work_id":"e22b5849-1e5c-4d18-9973-5ea982b594ef","year":2024},"citing_paper":{"arxiv_id":"2408.07666","last_updated":"2025-12-31T04:06:49Z","snapshot_observed_at":"2026-08-07T23:28:24.025478Z","submitted_at":"2024-08-14T16:58:48Z","title":"Model Merging in LLMs, MLLMs, and Beyond: Methods, Theories, Applications and Opportunities","version":5},"reference_index":177,"source":"pdf_text","source_observed_at":"2026-05-17T22:16:04.386706Z"},"links":{"cited_paper":"/paper/2406.16768","citing_paper":"/paper/2408.07666"},"observation_digest":"sha256:05c4123d095567060e35d0bc8a29ce274b5d5fff9242b5379f50296281f6a050","observation_id":"428c4a58-44a2-4fa8-a3b3-dfb568d3269e","resolution":{"observed_at":"2026-05-17T22:16:04.840454Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16768","last_updated":"2024-06-24T16:24:34Z","snapshot_observed_at":"2026-08-16T13:40:04.078262Z","submitted_at":"2024-06-24T16:24:34Z","title":"WARP: On the Benefits of Weight Averaged Rewarded Policies","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.16768","snapshot_observed_at":"2026-08-11T21:46:25.101061Z","title":"G., Girgin, S., Douillard, A., and Bachem, O","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.04144","last_updated":"2025-02-03T20:31:39Z","snapshot_observed_at":"2026-08-14T18:10:15.931299Z","submitted_at":"2024-12-05T13:12:51Z","title":"If You Can't Use Them, Recycle Them: Optimizing Merging at Scale Mitigates Performance Tradeoffs","version":3},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-11T21:46:25.101061Z"},"links":{"cited_paper":"/paper/2406.16768","citing_paper":"/paper/2412.04144"},"observation_digest":"sha256:a8e2b224847e3c76faf564d6ccb291e4c4fafdf5a80070e65629de6c30327fb0","observation_id":"f85ecb2d-b418-48fa-9bf8-4edc9e001be5","resolution":{"observed_at":"2026-08-11T21:46:25.101061Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16768","last_updated":"2024-06-24T16:24:34Z","snapshot_observed_at":"2026-08-16T13:40:04.078262Z","submitted_at":"2024-06-24T16:24:34Z","title":"WARP: On the Benefits of Weight Averaged Rewarded Policies","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.16768","snapshot_observed_at":"2026-08-11T19:24:43.395373Z","title":"Warp: On the benefits of weight aver- 11 aged rewarded policies","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.06712","last_updated":"2024-12-09T18:01:13Z","snapshot_observed_at":"2026-08-15T17:49:30.290283Z","submitted_at":"2024-12-09T18:01:13Z","title":"How to Merge Your Multimodal Models Over Time?","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-11T19:24:43.395373Z"},"links":{"cited_paper":"/paper/2406.16768","citing_paper":"/paper/2412.06712"},"observation_digest":"sha256:4477d6356416631a9f93cc97090c28a13de2b780ffe1e1560d92f3a2f2275e61","observation_id":"b6129d2b-060e-4258-b0ca-bb0d09a22cd2","resolution":{"observed_at":"2026-08-11T19:24:43.395373Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16768","last_updated":"2024-06-24T16:24:34Z","snapshot_observed_at":"2026-08-16T13:40:04.078262Z","submitted_at":"2024-06-24T16:24:34Z","title":"WARP: On the Benefits of Weight Averaged Rewarded Policies","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.16768","snapshot_observed_at":"2026-08-11T05:57:06.636580Z","title":"Warp: On the benefits of weight averaged rewarded policies","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.17023","last_updated":"2024-12-22T13:58:12Z","snapshot_observed_at":"2026-08-16T17:26:32.548276Z","submitted_at":"2024-12-22T13:58:12Z","title":"Parameter-Efficient Interventions for Enhanced Model Merging","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-11T05:57:06.636580Z"},"links":{"cited_paper":"/paper/2406.16768","citing_paper":"/paper/2412.17023"},"observation_digest":"sha256:6ecdfd6829a64197200312f5a144128e4f4584a1acc51ae9a853d956474e26a7","observation_id":"aead0e7d-5b5d-4a4e-9e6a-e63e1c18ff80","resolution":{"observed_at":"2026-08-11T05:57:06.636580Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16768","last_updated":"2024-06-24T16:24:34Z","snapshot_observed_at":"2026-08-16T13:40:04.078262Z","submitted_at":"2024-06-24T16:24:34Z","title":"WARP: On the Benefits of Weight Averaged Rewarded Policies","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.16768","snapshot_observed_at":"2026-08-09T18:11:28.155863Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.00674","last_updated":"2025-02-02T05:23:29Z","snapshot_observed_at":"2026-08-14T04:50:30.127326Z","submitted_at":"2025-02-02T05:23:29Z","title":"Rethinking Mixture-of-Agents: Is Mixing Different Large Language Models Beneficial?","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-09T18:11:28.155863Z"},"links":{"cited_paper":"/paper/2406.16768","citing_paper":"/paper/2502.00674"},"observation_digest":"sha256:6659657be8053a2d6e8bb70d059a94d86dfd486b5428ac150b35910c75353b8e","observation_id":"86b9cb94-65cf-403b-af4a-d78036678a0b","resolution":{"observed_at":"2026-08-09T18:11:28.155863Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16768","last_updated":"2024-06-24T16:24:34Z","snapshot_observed_at":"2026-08-16T13:40:04.078262Z","submitted_at":"2024-06-24T16:24:34Z","title":"WARP: On the Benefits of Weight Averaged Rewarded Policies","version":1},"cited_work":{"arxiv_id":"2406.16768","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.16768","snapshot_observed_at":"2026-07-04T10:49:45.640428Z","title":"Warp: On the benefits of weight averaged rewarded policies.arXiv preprint arXiv:2406.16768, 2024","venue":null,"work_id":"e22b5849-1e5c-4d18-9973-5ea982b594ef","year":2024},"citing_paper":{"arxiv_id":"2507.15698","last_updated":"2026-05-19T07:11:43Z","snapshot_observed_at":"2026-08-17T08:15:54.100360Z","submitted_at":"2025-07-21T15:07:59Z","title":"CoLD: Counterfactually-Guided Length Debiasing for Process Reward Models in Mathematical Reasoning","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-21T23:24:43.556606Z"},"links":{"cited_paper":"/paper/2406.16768","citing_paper":"/paper/2507.15698"},"observation_digest":"sha256:2b9d1e5a528d1c42c0bc72cf299b1ea3469b6dac401150617fc825576a61e060","observation_id":"62c27199-f8e2-4e43-9735-7098902b0d17","resolution":{"observed_at":"2026-05-21T23:25:45.301158Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16768","last_updated":"2024-06-24T16:24:34Z","snapshot_observed_at":"2026-08-16T13:40:04.078262Z","submitted_at":"2024-06-24T16:24:34Z","title":"WARP: On the Benefits of Weight Averaged Rewarded Policies","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.16768","snapshot_observed_at":"2026-08-06T14:49:40.309508Z","title":"WARP: on the benefits of weight averaged rewarded policies","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.17634","last_updated":"2025-08-11T08:36:31Z","snapshot_observed_at":"2026-08-14T20:34:00.378005Z","submitted_at":"2025-07-23T16:02:06Z","title":"WSM: Decay-Free Learning Rate Schedule via Checkpoint Merging for LLM Pre-training","version":2},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-06T14:49:40.309508Z"},"links":{"cited_paper":"/paper/2406.16768","citing_paper":"/paper/2507.17634"},"observation_digest":"sha256:634ac7fcc9fdee0dac82267daf3a7b7db1b3cfcc6da31532f6b6dbf713a628e9","observation_id":"f45b4229-3401-43fd-821a-02d59d43cf5c","resolution":{"observed_at":"2026-08-06T14:49:40.309508Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16768","last_updated":"2024-06-24T16:24:34Z","snapshot_observed_at":"2026-08-16T13:40:04.078262Z","submitted_at":"2024-06-24T16:24:34Z","title":"WARP: On the Benefits of Weight Averaged Rewarded Policies","version":1},"cited_work":{"arxiv_id":"2406.16768","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.16768","snapshot_observed_at":"2026-07-04T10:49:45.640428Z","title":"Warp: On the benefits of weight averaged rewarded policies.arXiv preprint arXiv:2406.16768, 2024","venue":null,"work_id":"e22b5849-1e5c-4d18-9973-5ea982b594ef","year":2024},"citing_paper":{"arxiv_id":"2604.13833","last_updated":"2026-04-16T05:28:11Z","snapshot_observed_at":"2026-08-11T14:46:48.035861Z","submitted_at":"2026-04-15T13:07:11Z","title":"Robust Reward Modeling for Large Language Models via Causal Decomposition","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-10T13:50:47.902911Z"},"links":{"cited_paper":"/paper/2406.16768","citing_paper":"/paper/2604.13833"},"observation_digest":"sha256:8e3820823c2fd7f3666c299ec00b1e8e538a3a21ed5bea336d54082882614ccf","observation_id":"93163713-4833-40c2-ad31-24fd5d384d74","resolution":{"observed_at":"2026-05-10T14:00:29.610326Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16768","last_updated":"2024-06-24T16:24:34Z","snapshot_observed_at":"2026-08-16T13:40:04.078262Z","submitted_at":"2024-06-24T16:24:34Z","title":"WARP: On the Benefits of Weight Averaged Rewarded Policies","version":1},"cited_work":{"arxiv_id":"2406.16768","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.16768","snapshot_observed_at":"2026-07-04T10:49:45.640428Z","title":"Warp: On the benefits of weight averaged rewarded policies.arXiv preprint arXiv:2406.16768, 2024","venue":null,"work_id":"e22b5849-1e5c-4d18-9973-5ea982b594ef","year":2024},"citing_paper":{"arxiv_id":"2605.00610","last_updated":"2026-05-01T12:20:44Z","snapshot_observed_at":"2026-08-17T15:17:48.897936Z","submitted_at":"2026-05-01T12:20:44Z","title":"Decouple before Integration: Test-time Synthesis of SFT and RLVR Task Vectors","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-05-09T19:05:51.423427Z"},"links":{"cited_paper":"/paper/2406.16768","citing_paper":"/paper/2605.00610"},"observation_digest":"sha256:02af0cf291fc9d7172a17be1fdec660945a8c52ce365943ce3ceb7eecfe92dc8","observation_id":"019fa1e6-8d02-4490-9c74-c9e6e96ea15c","resolution":{"observed_at":"2026-05-11T15:51:44.118097Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16768","last_updated":"2024-06-24T16:24:34Z","snapshot_observed_at":"2026-08-16T13:40:04.078262Z","submitted_at":"2024-06-24T16:24:34Z","title":"WARP: On the Benefits of Weight Averaged Rewarded Policies","version":1},"cited_work":{"arxiv_id":"2406.16768","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.16768","snapshot_observed_at":"2026-07-04T10:49:45.640428Z","title":"Warp: On the benefits of weight averaged rewarded policies.arXiv preprint arXiv:2406.16768, 2024","venue":null,"work_id":"e22b5849-1e5c-4d18-9973-5ea982b594ef","year":2024},"citing_paper":{"arxiv_id":"2605.20408","last_updated":"2026-05-19T19:04:47Z","snapshot_observed_at":"2026-07-06T23:30:58.549353Z","submitted_at":"2026-05-19T19:04:47Z","title":"Spectral Souping: A Unified Framework for Online Preference Alignment","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-21T07:54:56.356555Z"},"links":{"cited_paper":"/paper/2406.16768","citing_paper":"/paper/2605.20408"},"observation_digest":"sha256:0bfd7dd7678a7c5e31cd29049680bb0715879cc4178f87cbe68b6c93feaef041","observation_id":"2b0378f8-a329-4dc6-9fc7-2495ee8fec94","resolution":{"observed_at":"2026-05-21T07:59:50.966900Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16768","last_updated":"2024-06-24T16:24:34Z","snapshot_observed_at":"2026-08-16T13:40:04.078262Z","submitted_at":"2024-06-24T16:24:34Z","title":"WARP: On the Benefits of Weight Averaged Rewarded Policies","version":1},"cited_work":{"arxiv_id":"2406.16768","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.16768","snapshot_observed_at":"2026-07-04T10:49:45.640428Z","title":"Warp: On the benefits of weight averaged rewarded policies.arXiv preprint arXiv:2406.16768, 2024","venue":null,"work_id":"e22b5849-1e5c-4d18-9973-5ea982b594ef","year":2024},"citing_paper":{"arxiv_id":"2605.28751","last_updated":"2026-05-27T17:09:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-27T17:09:30Z","title":"Extrapolative Weight Averaging Reveals Correctness-Efficiency Frontiers in Code RL","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-06-29T14:41:13.191919Z"},"links":{"cited_paper":"/paper/2406.16768","citing_paper":"/paper/2605.28751"},"observation_digest":"sha256:dccb651733dbac61e56f8ede24109f645c453328e8139f85ab226104c1829c97","observation_id":"e6ed6dcf-6dbc-4c62-8e34-598f32f03cf7","resolution":{"observed_at":"2026-06-29T14:43:30.566219Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16768","last_updated":"2024-06-24T16:24:34Z","snapshot_observed_at":"2026-08-16T13:40:04.078262Z","submitted_at":"2024-06-24T16:24:34Z","title":"WARP: On the Benefits of Weight Averaged Rewarded Policies","version":1},"cited_work":{"arxiv_id":"2406.16768","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.16768","snapshot_observed_at":"2026-07-04T10:49:45.640428Z","title":"Warp: On the benefits of weight averaged rewarded policies.arXiv preprint arXiv:2406.16768, 2024","venue":null,"work_id":"e22b5849-1e5c-4d18-9973-5ea982b594ef","year":2024},"citing_paper":{"arxiv_id":"2606.23995","last_updated":"2026-06-22T23:05:01Z","snapshot_observed_at":"2026-08-13T14:13:47.714308Z","submitted_at":"2026-06-22T23:05:01Z","title":"EMAgnet: Parameter-Space EMA Regularization for Policy Gradient Self-Play in Large Games","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-06-26T08:32:51.215581Z"},"links":{"cited_paper":"/paper/2406.16768","citing_paper":"/paper/2606.23995"},"observation_digest":"sha256:837e030e1dce5bdcb69a3f28fa299fe46e0dc13efd368f87e8b8779ebaa75bf8","observation_id":"35c0e572-c422-4a72-b107-562b57def5ca","resolution":{"observed_at":"2026-07-04T10:49:45.642601Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16768","last_updated":"2024-06-24T16:24:34Z","snapshot_observed_at":"2026-08-16T13:40:04.078262Z","submitted_at":"2024-06-24T16:24:34Z","title":"WARP: On the Benefits of Weight Averaged Rewarded Policies","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.16768","snapshot_observed_at":"2026-07-11T13:53:36.775836Z","title":"arXiv preprint arXiv:2406.16768 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04763","last_updated":"2026-07-26T14:17:18Z","snapshot_observed_at":"2026-08-15T22:59:02.741838Z","submitted_at":"2026-07-06T07:56:53Z","title":"Multi-Turn On-Policy Distillation with Prefix Replay","version":1},"reference_index":253,"source":"arxiv_source","source_observed_at":"2026-07-11T13:53:36.775836Z"},"links":{"cited_paper":"/paper/2406.16768","citing_paper":"/paper/2607.04763"},"observation_digest":"sha256:5c5eec091bf080a6490586f8d2c04989790793a0e98797cd82371c56414c3a98","observation_id":"fa2ad06a-f529-4f59-ba2e-16cf000335e3","resolution":{"observed_at":"2026-07-11T13:53:36.775836Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16768","last_updated":"2024-06-24T16:24:34Z","snapshot_observed_at":"2026-08-16T13:40:04.078262Z","submitted_at":"2024-06-24T16:24:34Z","title":"WARP: On the Benefits of Weight Averaged Rewarded Policies","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.16768","snapshot_observed_at":"2026-08-02T08:41:01.803367Z","title":"arXiv preprint arXiv:2406.16768 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04763","last_updated":"2026-07-26T14:17:18Z","snapshot_observed_at":"2026-08-15T22:59:02.741838Z","submitted_at":"2026-07-06T07:56:53Z","title":"Multi-Turn On-Policy Distillation with Prefix Replay","version":3},"reference_index":254,"source":"arxiv_source","source_observed_at":"2026-08-02T08:41:01.803367Z"},"links":{"cited_paper":"/paper/2406.16768","citing_paper":"/paper/2607.04763"},"observation_digest":"sha256:9f5a518d1323adde31acf237b2baaedd6120f9be746785c57db44468310befc0","observation_id":"1bb0dc9b-1b41-4640-afce-55a0a7b8c1cc","resolution":{"observed_at":"2026-08-02T08:41:01.803367Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16768","last_updated":"2024-06-24T16:24:34Z","snapshot_observed_at":"2026-08-16T13:40:04.078262Z","submitted_at":"2024-06-24T16:24:34Z","title":"WARP: On the Benefits of Weight Averaged Rewarded Policies","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.16768","snapshot_observed_at":"2026-07-14T14:00:00.388339Z","title":"arXiv preprint arXiv:2406.16768 (2024) 2, 4","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.10147","last_updated":"2026-07-11T06:15:03Z","snapshot_observed_at":"2026-08-14T20:33:58.912858Z","submitted_at":"2026-07-11T06:15:03Z","title":"REVA-PO: Stabilizing Reinforcement Learning for Chest X-ray Report Generation","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-07-14T14:00:00.388339Z"},"links":{"cited_paper":"/paper/2406.16768","citing_paper":"/paper/2607.10147"},"observation_digest":"sha256:6d6ab627b093d48b03eee18fd7a109bd0860ef3473877c84e0a8c4033ef173bc","observation_id":"df289768-6da3-4973-a71b-1b7e9b3e94bb","resolution":{"observed_at":"2026-07-14T14:00:00.388339Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16768","last_updated":"2024-06-24T16:24:34Z","snapshot_observed_at":"2026-08-16T13:40:04.078262Z","submitted_at":"2024-06-24T16:24:34Z","title":"WARP: On the Benefits of Weight Averaged Rewarded Policies","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.16768","snapshot_observed_at":"2026-08-15T14:57:53.839991Z","title":"2406.16768 , archivePrefix=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03092","last_updated":"2026-08-04T04:08:08Z","snapshot_observed_at":"2026-08-17T16:13:23.834371Z","submitted_at":"2026-08-04T04:08:08Z","title":"SMOPD: Multi-Reward Reinforcement Learning via Specialize-and-Merge Online Policy Distillation","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-15T14:57:53.839991Z"},"links":{"cited_paper":"/paper/2406.16768","citing_paper":"/paper/2608.03092"},"observation_digest":"sha256:4279e74e75cce77b6a86ef0207255540213f1793a44ad9eafdaace35f1956b91","observation_id":"458571d0-4753-49b3-bc5e-b90ebef85fe3","resolution":{"observed_at":"2026-08-15T14:57:53.839991Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2406.16768/citation-record","integrity":"/paper/2406.16768/integrity","json":"/paper/2406.16768/citation-record.json","paper":"/paper/2406.16768"},"outbound":[],"paper":{"arxiv_id":"2406.16768","last_updated":"2024-06-24T16:24:34Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-16T13:40:04.078262Z","submitted_at":"2024-06-24T16:24:34Z","title":"WARP: On the Benefits of Weight Averaged Rewarded Policies"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"thesis":"As of 17 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 16 inbound Pith citation observations for arXiv:2406.16768."}