{"as_of":"2026-08-18T16:21:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:26ea173aff7384da65090b263db7d705d8bf905b8f4bb38f68b1263edb84f66c","coverage":[{"denominator":64,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":64,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T22:48:23.624843Z","state":"measured"},{"denominator":66,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":66,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-18T06:34:40.430872+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-10T22:51:52.719416Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-06T20:11:10.907552Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2412.03187","last_updated":"2025-02-26T11:10:48Z","snapshot_observed_at":"2026-08-14T23:16:37.529093Z","submitted_at":"2024-12-04T10:15:12Z","title":"Weighted-Reward Preference Optimization for Implicit Model Fusion","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.03187","snapshot_observed_at":"2026-08-10T22:51:52.719416Z","title":"Weighted -reward preference optimization for implicit model fusion,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.00562","last_updated":"2025-01-03T06:28:02Z","snapshot_observed_at":"2026-08-17T02:37:19.762864Z","submitted_at":"2024-12-31T17:48:33Z","title":"An Overview and Discussion on Using Large Language Models for Implementation Generation of Solutions to Open-Ended Problems","version":2},"reference_index":143,"source":"pdf_text","source_observed_at":"2026-08-10T22:51:52.719416Z"},"links":{"cited_paper":"/paper/2412.03187","citing_paper":"/paper/2501.00562"},"observation_digest":"sha256:70347003cca80a4baec6875b92fd96a4ab8a64d5feb52404890708e0bab922f3","observation_id":"a0e3fefa-5e6f-441f-8143-9a1d15942330","resolution":{"observed_at":"2026-08-10T22:51:52.719416Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03187","last_updated":"2025-02-26T11:10:48Z","snapshot_observed_at":"2026-08-14T23:16:37.529093Z","submitted_at":"2024-12-04T10:15:12Z","title":"Weighted-Reward Preference Optimization for Implicit Model Fusion","version":2},"cited_work":{"arxiv_id":"2412.03187","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.03187","snapshot_observed_at":"2026-08-06T20:11:10.907552Z","title":"Weighted-Reward Preference Optimization for Implicit Model Fusion","venue":"cs.CL","work_id":"451b5e9a-cbc0-4ea6-aa64-2d4fb8f7d751","year":2024},"citing_paper":{"arxiv_id":"2507.03928","last_updated":"2025-07-05T07:23:15Z","snapshot_observed_at":"2026-08-14T23:17:24.199467Z","submitted_at":"2025-07-05T07:23:15Z","title":"CortexDebate: Debating Sparsely and Equally for Multi-Agent Debate","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-06T20:11:10.783132Z"},"links":{"cited_paper":"/paper/2412.03187","citing_paper":"/paper/2507.03928"},"observation_digest":"sha256:789b02617744aff9c30c3e3c02817c55f6a90abaa475d955e92743fb3d8e2008","observation_id":"048901a7-3233-4835-a467-f5e9c1f57323","resolution":{"observed_at":"2026-08-06T20:11:10.913347Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2412.03187/citation-record","integrity":"/paper/2412.03187/integrity","json":"/paper/2412.03187/citation-record.json","paper":"/paper/2412.03187"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2404.14219","last_updated":"2024-08-30T21:17:17Z","snapshot_observed_at":"2026-08-17T03:25:04.404839Z","submitted_at":"2024-04-22T14:32:33Z","title":"Phi-3 Technical Report: A Highly Capable Language Model Locally on Your Phone","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.14219","snapshot_observed_at":"2026-08-11T22:48:20.804753Z","title":"Phi-3 technical report: A highly capable language model locally on your phone","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.03187","last_updated":"2025-02-26T11:10:48Z","snapshot_observed_at":"2026-08-14T23:16:37.529093Z","submitted_at":"2024-12-04T10:15:12Z","title":"Weighted-Reward Preference Optimization for Implicit Model Fusion","version":2},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-11T22:48:20.804753Z"},"links":{"cited_paper":"/paper/2404.14219","citing_paper":"/paper/2412.03187"},"observation_digest":"sha256:02d28e9881da8127d488c140d83f1c415d324a79f0d02d8127eb9b38d67fb194","observation_id":"fa2df7e7-2a38-4ae8-81f6-a448f0adc125","resolution":{"observed_at":"2026-08-11T22:48:20.804753Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:48:33.301127Z","title":"A general theoretical paradigm to understand learning from human preferences","venue":null,"work_id":"08bac8cd-aabb-4249-afdc-fc6e516e8ca4","year":2024},"citing_paper":{"arxiv_id":"2412.03187","last_updated":"2025-02-26T11:10:48Z","snapshot_observed_at":"2026-08-14T23:16:37.529093Z","submitted_at":"2024-12-04T10:15:12Z","title":"Weighted-Reward Preference Optimization for Implicit Model Fusion","version":2},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-11T22:48:20.835140Z"},"links":{"citing_paper":"/paper/2412.03187"},"observation_digest":"sha256:dd44c3f3896e8dee4aa0bf64d55f9cf26caec95e4200854a847ea6b721a519fb","observation_id":"c76c5867-7d6f-4880-b9a9-a7566584a428","resolution":{"observed_at":"2026-08-11T22:48:33.334877Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:48:33.027379Z","title":"Open LLM leaderboard, 2023","venue":null,"work_id":"8cb76df9-3077-42f1-99c9-6faa58574bda","year":2023},"citing_paper":{"arxiv_id":"2412.03187","last_updated":"2025-02-26T11:10:48Z","snapshot_observed_at":"2026-08-14T23:16:37.529093Z","submitted_at":"2024-12-04T10:15:12Z","title":"Weighted-Reward Preference Optimization for Implicit Model Fusion","version":2},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-11T22:48:20.884774Z"},"links":{"citing_paper":"/paper/2412.03187"},"observation_digest":"sha256:1a06f6fe554ad87961e3c980f453bc93363443b183667e4a7621abd32c76c609","observation_id":"bdb6a074-362c-4ba7-9477-72c4a49ccc0b","resolution":{"observed_at":"2026-08-11T22:48:33.174881Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:48:32.907998Z","title":null,"venue":null,"work_id":"fa1a00b5-8e84-4e76-a7e8-70bc7fd24118","year":1952},"citing_paper":{"arxiv_id":"2412.03187","last_updated":"2025-02-26T11:10:48Z","snapshot_observed_at":"2026-08-14T23:16:37.529093Z","submitted_at":"2024-12-04T10:15:12Z","title":"Weighted-Reward Preference Optimization for Implicit Model Fusion","version":2},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-11T22:48:20.934756Z"},"links":{"citing_paper":"/paper/2412.03187"},"observation_digest":"sha256:64d55882590bc10b41c212e3b22e3b5ab5033138f9a19e915fa7f81762a88299","observation_id":"e9b26107-200c-4ea6-8594-0de858eda617","resolution":{"observed_at":"2026-08-11T22:48:32.949019Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.17297","last_updated":"2024-03-26T00:53:24Z","snapshot_observed_at":"2026-08-12T16:46:46.561976Z","submitted_at":"2024-03-26T00:53:24Z","title":"InternLM2 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.17297","snapshot_observed_at":"2026-08-11T22:48:20.994770Z","title":"InternLM2 technical report","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.03187","last_updated":"2025-02-26T11:10:48Z","snapshot_observed_at":"2026-08-14T23:16:37.529093Z","submitted_at":"2024-12-04T10:15:12Z","title":"Weighted-Reward Preference Optimization for Implicit Model Fusion","version":2},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-11T22:48:20.994770Z"},"links":{"cited_paper":"/paper/2403.17297","citing_paper":"/paper/2412.03187"},"observation_digest":"sha256:1aa4a663295ee364822a68f7548dd5fa4324471f93b870c135511fb25de7d820","observation_id":"987c2692-9544-4c07-b914-d8402c1e2058","resolution":{"observed_at":"2026-08-11T22:48:20.994770Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:48:32.819301Z","title":"Chatbot arena: An open platform for evaluating llms by human preference","venue":null,"work_id":"6a6a4dda-dd1a-4fa7-a65e-c1721fa9d84d","year":2024},"citing_paper":{"arxiv_id":"2412.03187","last_updated":"2025-02-26T11:10:48Z","snapshot_observed_at":"2026-08-14T23:16:37.529093Z","submitted_at":"2024-12-04T10:15:12Z","title":"Weighted-Reward Preference Optimization for Implicit Model Fusion","version":2},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-11T22:48:21.044765Z"},"links":{"citing_paper":"/paper/2412.03187"},"observation_digest":"sha256:1d66f7d001dc660ce7e612b997e9ed170461c7ab0e31280ed6fd130c574ada98","observation_id":"677a8ea8-e4b1-471b-9057-b5df9428d530","resolution":{"observed_at":"2026-08-11T22:48:32.842939Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:48:32.647546Z","title":"Deep reinforcement learning from human preferences","venue":null,"work_id":"c59071a2-cf58-46b1-8756-cc349cbae473","year":2017},"citing_paper":{"arxiv_id":"2412.03187","last_updated":"2025-02-26T11:10:48Z","snapshot_observed_at":"2026-08-14T23:16:37.529093Z","submitted_at":"2024-12-04T10:15:12Z","title":"Weighted-Reward Preference Optimization for Implicit Model Fusion","version":2},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-11T22:48:21.104765Z"},"links":{"citing_paper":"/paper/2412.03187"},"observation_digest":"sha256:84009bdcbcaccfb80ed269ccee3793e69ce3844858d343d86f0ce877fc97b918","observation_id":"75da1c39-57b2-44ae-9b86-3e9eeef209c1","resolution":{"observed_at":"2026-08-11T22:48:32.691427Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:48:32.522902Z","title":"Bam! born-again multi-task networks for natural language understanding","venue":null,"work_id":"91d9cd23-5bab-444d-b56d-886a456b2944","year":2019},"citing_paper":{"arxiv_id":"2412.03187","last_updated":"2025-02-26T11:10:48Z","snapshot_observed_at":"2026-08-14T23:16:37.529093Z","submitted_at":"2024-12-04T10:15:12Z","title":"Weighted-Reward Preference Optimization for Implicit Model Fusion","version":2},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-11T22:48:21.144759Z"},"links":{"citing_paper":"/paper/2412.03187"},"observation_digest":"sha256:4a1ea3e7e95612abaf834d5090db20534be36ff5162de5528fa5a41286988e94","observation_id":"8efe2630-5fd6-480c-a619-03799a56b386","resolution":{"observed_at":"2026-08-11T22:48:32.555244Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1803.05457","last_updated":"2018-03-14T18:04:21Z","snapshot_observed_at":"2026-08-14T19:36:07.505691Z","submitted_at":"2018-03-14T18:04:21Z","title":"Think you have Solved Question Answering? Try ARC, the AI2 Reasoning Challenge","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1803.05457","snapshot_observed_at":"2026-08-11T22:48:21.194759Z","title":"Think you have solved question answering? try arc, the ai2 reasoning challenge","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2412.03187","last_updated":"2025-02-26T11:10:48Z","snapshot_observed_at":"2026-08-14T23:16:37.529093Z","submitted_at":"2024-12-04T10:15:12Z","title":"Weighted-Reward Preference Optimization for Implicit Model Fusion","version":2},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-11T22:48:21.194759Z"},"links":{"cited_paper":"/paper/1803.05457","citing_paper":"/paper/2412.03187"},"observation_digest":"sha256:23668b936bcdc1bd20f9e3faf4ecc6c43ae25ddb3f0496cf0862e3a5a3aa5f96","observation_id":"4263d49a-429a-4b04-bd54-bb3e996081d2","resolution":{"observed_at":"2026-08-11T22:48:21.194759Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.14168","last_updated":"2021-11-18T00:23:45Z","snapshot_observed_at":"2026-08-14T02:43:01.480086Z","submitted_at":"2021-10-27T04:49:45Z","title":"Training Verifiers to Solve Math Word Problems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.14168","snapshot_observed_at":"2026-08-11T22:48:21.244866Z","title":"Training verifiers to solve math word problems","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.03187","last_updated":"2025-02-26T11:10:48Z","snapshot_observed_at":"2026-08-14T23:16:37.529093Z","submitted_at":"2024-12-04T10:15:12Z","title":"Weighted-Reward Preference Optimization for Implicit Model Fusion","version":2},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-11T22:48:21.244866Z"},"links":{"cited_paper":"/paper/2110.14168","citing_paper":"/paper/2412.03187"},"observation_digest":"sha256:0209df321dd7e4b6c8f3cc4d92afb46220252b855284c72add31b28d17ac8044","observation_id":"dec28621-fc3c-495a-9e78-847e6f835a64","resolution":{"observed_at":"2026-08-11T22:48:21.244866Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:48:32.370540Z","title":"UltraFeedback : Boosting language models with high-quality feedback","venue":null,"work_id":"014671f4-f614-4077-988a-170288f55dd6","year":2024},"citing_paper":{"arxiv_id":"2412.03187","last_updated":"2025-02-26T11:10:48Z","snapshot_observed_at":"2026-08-14T23:16:37.529093Z","submitted_at":"2024-12-04T10:15:12Z","title":"Weighted-Reward Preference Optimization for Implicit Model Fusion","version":2},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-11T22:48:21.284752Z"},"links":{"citing_paper":"/paper/2412.03187"},"observation_digest":"sha256:49db1493ac4a4a747ca44781acae4d6db1e890036ff503ce3fd0ec23da28a27f","observation_id":"99746a63-d289-449a-850a-58eafb68ee0e","resolution":{"observed_at":"2026-08-11T22:48:32.434853Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11931","last_updated":"2024-06-17T13:51:35Z","snapshot_observed_at":"2026-08-14T04:42:19.578053Z","submitted_at":"2024-06-17T13:51:35Z","title":"DeepSeek-Coder-V2: Breaking the Barrier of Closed-Source Models in Code Intelligence","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.11931","snapshot_observed_at":"2026-08-11T22:48:21.328808Z","title":"DeepSeek-Coder-V2 : Breaking the barrier of closed-source models in code intelligence","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.03187","last_updated":"2025-02-26T11:10:48Z","snapshot_observed_at":"2026-08-14T23:16:37.529093Z","submitted_at":"2024-12-04T10:15:12Z","title":"Weighted-Reward Preference Optimization for Implicit Model Fusion","version":2},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-11T22:48:21.328808Z"},"links":{"cited_paper":"/paper/2406.11931","citing_paper":"/paper/2412.03187"},"observation_digest":"sha256:3eb813c1f00af4f2d7c96a65a48699aea575397c6d16a63fed960dcaca408227","observation_id":"4775cba0-af72-4f46-8be1-4022df2dfb1e","resolution":{"observed_at":"2026-08-11T22:48:21.328808Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-13T17:20:44.002518Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-11T22:48:21.377609Z","title":"The llama 3 herd of models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.03187","last_updated":"2025-02-26T11:10:48Z","snapshot_observed_at":"2026-08-14T23:16:37.529093Z","submitted_at":"2024-12-04T10:15:12Z","title":"Weighted-Reward Preference Optimization for Implicit Model Fusion","version":2},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-11T22:48:21.377609Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2412.03187"},"observation_digest":"sha256:fd2957bf1e441a6aa8d79296e35eadd6d7b4e1cd822761b0554f7dff1daa1bff","observation_id":"4205d85a-e57f-482f-a4ee-369bee78b7b4","resolution":{"observed_at":"2026-08-11T22:48:21.377609Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:48:32.197216Z","title":"Length-controlled alpacaeval: A simple debiasing of automatic evaluators","venue":null,"work_id":"debde3f7-f738-49e4-a45f-d6adcb616351","year":2024},"citing_paper":{"arxiv_id":"2412.03187","last_updated":"2025-02-26T11:10:48Z","snapshot_observed_at":"2026-08-14T23:16:37.529093Z","submitted_at":"2024-12-04T10:15:12Z","title":"Weighted-Reward Preference Optimization for Implicit Model Fusion","version":2},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-11T22:48:21.434760Z"},"links":{"citing_paper":"/paper/2412.03187"},"observation_digest":"sha256:cd4bc33f07e1c0a2952b7cdc5800d3bc7118a9eff40fd8d26401f932d2dd428f","observation_id":"20a5d6cd-c4ec-4816-86ff-08c7e97c2fbb","resolution":{"observed_at":"2026-08-11T22:48:32.266933Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:48:31.999107Z","title":"KTO : Model alignment as prospect theoretic optimization","venue":null,"work_id":"2d72f5bf-ee5a-43d4-a222-11b1db1ee28d","year":2024},"citing_paper":{"arxiv_id":"2412.03187","last_updated":"2025-02-26T11:10:48Z","snapshot_observed_at":"2026-08-14T23:16:37.529093Z","submitted_at":"2024-12-04T10:15:12Z","title":"Weighted-Reward Preference Optimization for Implicit Model Fusion","version":2},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-11T22:48:21.482693Z"},"links":{"citing_paper":"/paper/2412.03187"},"observation_digest":"sha256:7f0ac22cb423f852efc6bbb5485ff098f92cda3f39cefbb3caf39a549460192d","observation_id":"8da83c02-4804-4967-9bb1-7eb79634432d","resolution":{"observed_at":"2026-08-11T22:48:32.035409Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:48:31.834770Z","title":"Mixture-of-LoRAs : An efficient multitask tuning method for large language models","venue":null,"work_id":"804a9140-8000-429f-aa03-41bb5b891446","year":2024},"citing_paper":{"arxiv_id":"2412.03187","last_updated":"2025-02-26T11:10:48Z","snapshot_observed_at":"2026-08-14T23:16:37.529093Z","submitted_at":"2024-12-04T10:15:12Z","title":"Weighted-Reward Preference Optimization for Implicit Model Fusion","version":2},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-11T22:48:21.524750Z"},"links":{"citing_paper":"/paper/2412.03187"},"observation_digest":"sha256:11a3db9647a8e06f7f03335e2f677c45c39bc496796d59479a3ddb675f1f8574","observation_id":"2baf45e3-cc3b-4972-a0f4-44b46327981e","resolution":{"observed_at":"2026-08-11T22:48:31.862767Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:48:21.564921Z","title":"Knowledge distillation: A survey","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.03187","last_updated":"2025-02-26T11:10:48Z","snapshot_observed_at":"2026-08-14T23:16:37.529093Z","submitted_at":"2024-12-04T10:15:12Z","title":"Weighted-Reward Preference Optimization for Implicit Model Fusion","version":2},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-11T22:48:21.564921Z"},"links":{"citing_paper":"/paper/2412.03187"},"observation_digest":"sha256:897cb7a0380f008acb47e2e44946c4ee1ad4c6f976eab574c85cb0ec42c932f7","observation_id":"b06abde6-cfcb-432d-8c9a-76e6b9a41b08","resolution":{"observed_at":"2026-08-11T22:48:21.564921Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:48:21.603599Z","title":"Measuring massive multitask language understanding","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.03187","last_updated":"2025-02-26T11:10:48Z","snapshot_observed_at":"2026-08-14T23:16:37.529093Z","submitted_at":"2024-12-04T10:15:12Z","title":"Weighted-Reward Preference Optimization for Implicit Model Fusion","version":2},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-11T22:48:21.603599Z"},"links":{"citing_paper":"/paper/2412.03187"},"observation_digest":"sha256:e090471cef050a26e4ff2ef98e1e143d8ba703c15636101a29d77073109931fc","observation_id":"a1f363a1-e440-4dc5-928a-8ccb7c20441c","resolution":{"observed_at":"2026-08-11T22:48:21.603599Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:48:31.544731Z","title":"ORPO : Monolithic preference optimization without reference model","venue":null,"work_id":"62669ced-b0ae-42bd-a042-6d981bf95152","year":2024},"citing_paper":{"arxiv_id":"2412.03187","last_updated":"2025-02-26T11:10:48Z","snapshot_observed_at":"2026-08-14T23:16:37.529093Z","submitted_at":"2024-12-04T10:15:12Z","title":"Weighted-Reward Preference Optimization for Implicit Model Fusion","version":2},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-11T22:48:21.652923Z"},"links":{"citing_paper":"/paper/2412.03187"},"observation_digest":"sha256:5494ce9f9dbb30b64520a37cef377a86f7d2e78a9f543a28c87bdf29bb265c16","observation_id":"aa7b7eef-46de-4541-a4d0-aab10c131917","resolution":{"observed_at":"2026-08-11T22:48:31.584902Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06825","last_updated":"2023-10-10T17:54:58Z","snapshot_observed_at":"2026-08-17T20:30:34.016254Z","submitted_at":"2023-10-10T17:54:58Z","title":"Mistral 7B","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06825","snapshot_observed_at":"2026-08-11T22:48:21.684381Z","title":"Mistral 7B","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.03187","last_updated":"2025-02-26T11:10:48Z","snapshot_observed_at":"2026-08-14T23:16:37.529093Z","submitted_at":"2024-12-04T10:15:12Z","title":"Weighted-Reward Preference Optimization for Implicit Model Fusion","version":2},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-11T22:48:21.684381Z"},"links":{"cited_paper":"/paper/2310.06825","citing_paper":"/paper/2412.03187"},"observation_digest":"sha256:3f4626a474a9492aca769fef13a6ce7147ea4f0880ac78f5dc365c2d586201c8","observation_id":"54fed2fb-f0d6-479c-9507-7c9b79833f0c","resolution":{"observed_at":"2026-08-11T22:48:21.684381Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:48:31.380909Z","title":"LLM-Blender : Ensembling large language models with pairwise ranking and generative fusion","venue":null,"work_id":"c2bf2c57-2bca-4067-9057-2baecffc248f","year":2023},"citing_paper":{"arxiv_id":"2412.03187","last_updated":"2025-02-26T11:10:48Z","snapshot_observed_at":"2026-08-14T23:16:37.529093Z","submitted_at":"2024-12-04T10:15:12Z","title":"Weighted-Reward Preference Optimization for Implicit Model Fusion","version":2},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-11T22:48:21.743745Z"},"links":{"citing_paper":"/paper/2412.03187"},"observation_digest":"sha256:f675c7c0566df0d180e15c7b39e4aebb508908b17c97b199cae0c57e6ec8b99f","observation_id":"4bb2d512-e04d-45e5-ba3b-8329bef43f20","resolution":{"observed_at":"2026-08-11T22:48:31.424752Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:48:31.232095Z","title":"Knowledge-augmented reasoning distillation for small language models in knowledge-intensive tasks","venue":null,"work_id":"71096300-29ac-497d-bdf2-b26400b1467e","year":2023},"citing_paper":{"arxiv_id":"2412.03187","last_updated":"2025-02-26T11:10:48Z","snapshot_observed_at":"2026-08-14T23:16:37.529093Z","submitted_at":"2024-12-04T10:15:12Z","title":"Weighted-Reward Preference Optimization for Implicit Model Fusion","version":2},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-11T22:48:21.794161Z"},"links":{"citing_paper":"/paper/2412.03187"},"observation_digest":"sha256:2f1baa58d5cff128ae2ece76a281237bc7f821e043e9a856cc16f02d364fecc0","observation_id":"15c4804b-f6ab-4a43-9567-4db7889c7fe1","resolution":{"observed_at":"2026-08-11T22:48:31.284748Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:48:21.832430Z","title":"Sparse upcycling: Training mixture-of-experts from dense checkpoints","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.03187","last_updated":"2025-02-26T11:10:48Z","snapshot_observed_at":"2026-08-14T23:16:37.529093Z","submitted_at":"2024-12-04T10:15:12Z","title":"Weighted-Reward Preference Optimization for Implicit Model Fusion","version":2},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-11T22:48:21.832430Z"},"links":{"citing_paper":"/paper/2412.03187"},"observation_digest":"sha256:1f78b5f29ae1259a680d87a6d0aa09c170b4f174602a853ee96e2dede6ea3f17","observation_id":"fd62c6fa-1447-42cd-9bfc-d72675134404","resolution":{"observed_at":"2026-08-11T22:48:21.832430Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:48:31.061705Z","title":"The Winograd schema challenge","venue":null,"work_id":"0e5276bf-1994-4d2a-a462-79488de03e70","year":2012},"citing_paper":{"arxiv_id":"2412.03187","last_updated":"2025-02-26T11:10:48Z","snapshot_observed_at":"2026-08-14T23:16:37.529093Z","submitted_at":"2024-12-04T10:15:12Z","title":"Weighted-Reward Preference Optimization for Implicit Model Fusion","version":2},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-11T22:48:21.845103Z"},"links":{"citing_paper":"/paper/2412.03187"},"observation_digest":"sha256:b349302ed54c53c043d7a43238398bf83248ce32bf935ee2a7574474f430cb86","observation_id":"77196ec9-fd79-4e11-b815-dd2375a1c2a3","resolution":{"observed_at":"2026-08-11T22:48:31.095024Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11939","last_updated":"2024-10-14T18:11:58Z","snapshot_observed_at":"2026-08-11T09:34:38.920981Z","submitted_at":"2024-06-17T17:26:10Z","title":"From Crowdsourced Data to High-Quality Benchmarks: Arena-Hard and BenchBuilder Pipeline","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.11939","snapshot_observed_at":"2026-08-11T22:48:21.873622Z","title":"From crowdsourced data to high-quality benchmarks: Arena-hard and benchbuilder pipeline","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.03187","last_updated":"2025-02-26T11:10:48Z","snapshot_observed_at":"2026-08-14T23:16:37.529093Z","submitted_at":"2024-12-04T10:15:12Z","title":"Weighted-Reward Preference Optimization for Implicit Model Fusion","version":2},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-11T22:48:21.873622Z"},"links":{"cited_paper":"/paper/2406.11939","citing_paper":"/paper/2412.03187"},"observation_digest":"sha256:e55df68ad9e875ae8f00e3c9959fe95a8b1f248260302103846182de2cb6684c","observation_id":"6fe8371d-ad98-4b69-a366-edf870852903","resolution":{"observed_at":"2026-08-11T22:48:21.873622Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:48:30.824966Z","title":"Hashimoto","venue":null,"work_id":"fd514723-eefa-47c4-a1bb-b34f56e2850b","year":2023},"citing_paper":{"arxiv_id":"2412.03187","last_updated":"2025-02-26T11:10:48Z","snapshot_observed_at":"2026-08-14T23:16:37.529093Z","submitted_at":"2024-12-04T10:15:12Z","title":"Weighted-Reward Preference Optimization for Implicit Model Fusion","version":2},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-11T22:48:21.920898Z"},"links":{"citing_paper":"/paper/2412.03187"},"observation_digest":"sha256:581e83adb0d40ed6cef20a6aaa8aea240a92498d9c796e47a701ec5e99c846ce","observation_id":"ff6ab5db-0b08-48ac-9aab-9da365e0c9c6","resolution":{"observed_at":"2026-08-11T22:48:30.865591Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:48:30.672894Z","title":"TruthfulQA : Measuring how models mimic human falsehoods","venue":null,"work_id":"51e38f87-d882-4947-9cc0-2315f2a633d7","year":2022},"citing_paper":{"arxiv_id":"2412.03187","last_updated":"2025-02-26T11:10:48Z","snapshot_observed_at":"2026-08-14T23:16:37.529093Z","submitted_at":"2024-12-04T10:15:12Z","title":"Weighted-Reward Preference Optimization for Implicit Model Fusion","version":2},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-11T22:48:21.960673Z"},"links":{"citing_paper":"/paper/2412.03187"},"observation_digest":"sha256:3b48a4bcdd0f8abbff2d5c16b2b31d2616817ec3ebdfcc0aa77455d73bdbf685","observation_id":"bbb2b5b4-11a8-4b72-b300-044db28310ad","resolution":{"observed_at":"2026-08-11T22:48:30.724753Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:48:30.599097Z","title":"Merging models with fisher-weighted averaging","venue":null,"work_id":"d772e3a9-c6f9-4796-b015-026642288125","year":2022},"citing_paper":{"arxiv_id":"2412.03187","last_updated":"2025-02-26T11:10:48Z","snapshot_observed_at":"2026-08-14T23:16:37.529093Z","submitted_at":"2024-12-04T10:15:12Z","title":"Weighted-Reward Preference Optimization for Implicit Model Fusion","version":2},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-11T22:48:21.994757Z"},"links":{"citing_paper":"/paper/2412.03187"},"observation_digest":"sha256:903a204f97964ee0e87831bb45c81dcc38e4c879513957f67cfdeee9136045ea","observation_id":"f0d68b7d-1d6c-48be-8a21-650a12966267","resolution":{"observed_at":"2026-08-11T22:48:30.623625Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:48:30.425014Z","title":"Pack of LLM s: Model fusion at test-time via perplexity optimization","venue":null,"work_id":"96948cae-e98d-4ee0-b9e8-9d5ca7e1ef70","year":2024},"citing_paper":{"arxiv_id":"2412.03187","last_updated":"2025-02-26T11:10:48Z","snapshot_observed_at":"2026-08-14T23:16:37.529093Z","submitted_at":"2024-12-04T10:15:12Z","title":"Weighted-Reward Preference Optimization for Implicit Model Fusion","version":2},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-11T22:48:22.034789Z"},"links":{"citing_paper":"/paper/2412.03187"},"observation_digest":"sha256:486b80458decbd54bb0783637d342a7fffc09bf67bb75eb059fef46b80529bef","observation_id":"f8078d2c-c058-4bb7-9de5-059fc087da29","resolution":{"observed_at":"2026-08-11T22:48:30.463719Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:48:30.234930Z","title":"Sim PO : Simple preference optimization with a reference-free reward","venue":null,"work_id":"43646df0-3c0a-470a-b5e5-b02c10e0a2e0","year":2024},"citing_paper":{"arxiv_id":"2412.03187","last_updated":"2025-02-26T11:10:48Z","snapshot_observed_at":"2026-08-14T23:16:37.529093Z","submitted_at":"2024-12-04T10:15:12Z","title":"Weighted-Reward Preference Optimization for Implicit Model Fusion","version":2},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-11T22:48:22.084755Z"},"links":{"citing_paper":"/paper/2412.03187"},"observation_digest":"sha256:739bfa832be27eeaccd94bf0533ebf374803e5ed739f801b2b76b5cbba501ed7","observation_id":"bd9bc18c-2682-4fd9-836a-1b4bf1f82c66","resolution":{"observed_at":"2026-08-11T22:48:30.351095Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.19159","last_updated":"2024-09-09T04:39:31Z","snapshot_observed_at":"2026-08-16T14:05:38.679805Z","submitted_at":"2024-03-28T06:03:47Z","title":"Disentangling Length from Quality in Direct Preference Optimization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.19159","snapshot_observed_at":"2026-08-11T22:48:22.144929Z","title":"Disentangling length from quality in direct preference optimization","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.03187","last_updated":"2025-02-26T11:10:48Z","snapshot_observed_at":"2026-08-14T23:16:37.529093Z","submitted_at":"2024-12-04T10:15:12Z","title":"Weighted-Reward Preference Optimization for Implicit Model Fusion","version":2},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-11T22:48:22.144929Z"},"links":{"cited_paper":"/paper/2403.19159","citing_paper":"/paper/2412.03187"},"observation_digest":"sha256:60cf8145ad26a41d9b35caa13325e2b24a9c6ac730aad76b50002bb55492a863","observation_id":"3e6431bc-985d-43d4-955b-60e0b6ec7616","resolution":{"observed_at":"2026-08-11T22:48:22.144929Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:48:30.034761Z","title":"Manning, and Chelsea Finn","venue":null,"work_id":"baf48d5a-4b1b-4745-90e2-ac2f1543fd0b","year":2023},"citing_paper":{"arxiv_id":"2412.03187","last_updated":"2025-02-26T11:10:48Z","snapshot_observed_at":"2026-08-14T23:16:37.529093Z","submitted_at":"2024-12-04T10:15:12Z","title":"Weighted-Reward Preference Optimization for Implicit Model Fusion","version":2},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-11T22:48:22.194770Z"},"links":{"citing_paper":"/paper/2412.03187"},"observation_digest":"sha256:355fecd8328ab504b1394b7917f503bba24720f3720feaa805d6f0bcfdad0bcd","observation_id":"98b82278-b6b4-4165-94e5-789218940319","resolution":{"observed_at":"2026-08-11T22:48:30.094762Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:48:29.864768Z","title":"Aligning large and small language models via chain-of-thought reasoning","venue":null,"work_id":"386d0bb2-4eef-430d-94ba-8b3ffd641cea","year":2024},"citing_paper":{"arxiv_id":"2412.03187","last_updated":"2025-02-26T11:10:48Z","snapshot_observed_at":"2026-08-14T23:16:37.529093Z","submitted_at":"2024-12-04T10:15:12Z","title":"Weighted-Reward Preference Optimization for Implicit Model Fusion","version":2},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-11T22:48:22.244758Z"},"links":{"citing_paper":"/paper/2412.03187"},"observation_digest":"sha256:c4fcabd2aa1141de7f2341c9c48577783e0f163a8d8cf10bd5cf5c2ef92e912b","observation_id":"79fa6a87-56a2-4519-a243-40057d8fa9ce","resolution":{"observed_at":"2026-08-11T22:48:29.914920Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.00118","last_updated":"2024-10-02T15:22:49Z","snapshot_observed_at":"2026-08-02T16:20:09.773989Z","submitted_at":"2024-07-31T19:13:07Z","title":"Gemma 2: Improving Open Language Models at a Practical Size","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.00118","snapshot_observed_at":"2026-08-11T22:48:22.295318Z","title":"Gemma 2: Improving open language models at a practical size","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.03187","last_updated":"2025-02-26T11:10:48Z","snapshot_observed_at":"2026-08-14T23:16:37.529093Z","submitted_at":"2024-12-04T10:15:12Z","title":"Weighted-Reward Preference Optimization for Implicit Model Fusion","version":2},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-11T22:48:22.295318Z"},"links":{"cited_paper":"/paper/2408.00118","citing_paper":"/paper/2412.03187"},"observation_digest":"sha256:1ba818593e704d03d1cae89814eef98456d5f34414011ebe7b73edbbb584dbca","observation_id":"2d02388b-eada-4469-abc7-d2ef482a2652","resolution":{"observed_at":"2026-08-11T22:48:22.295318Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-08-15T20:26:32.102285Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-11T22:48:22.334184Z","title":"Proximal policy optimization algorithms","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2412.03187","last_updated":"2025-02-26T11:10:48Z","snapshot_observed_at":"2026-08-14T23:16:37.529093Z","submitted_at":"2024-12-04T10:15:12Z","title":"Weighted-Reward Preference Optimization for Implicit Model Fusion","version":2},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-11T22:48:22.334184Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2412.03187"},"observation_digest":"sha256:0610a06788b3a1d4ad6130d4fd2ca423a65b038917a8c2f2a39fdfb810c665c2","observation_id":"95793e4b-f7db-4d41-b673-26c64e9f09cd","resolution":{"observed_at":"2026-08-11T22:48:22.334184Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.04434","last_updated":"2024-06-19T06:04:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-07T15:56:43Z","title":"DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.04434","snapshot_observed_at":"2026-08-11T22:48:22.404833Z","title":"DeepSeek-V2 : A strong, economical, and efficient mixture-of-experts language model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.03187","last_updated":"2025-02-26T11:10:48Z","snapshot_observed_at":"2026-08-14T23:16:37.529093Z","submitted_at":"2024-12-04T10:15:12Z","title":"Weighted-Reward Preference Optimization for Implicit Model Fusion","version":2},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-11T22:48:22.404833Z"},"links":{"cited_paper":"/paper/2405.04434","citing_paper":"/paper/2412.03187"},"observation_digest":"sha256:8d80bc699f91342fa6536ac9c979a2ffe5aa7109b1962d3e0f4058590066bf21","observation_id":"e92aa4d9-474d-4f0c-9bc9-6f4ec3430183","resolution":{"observed_at":"2026-08-11T22:48:22.404833Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:48:22.454900Z","title":"ProFuser : Progressive fusion of large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.03187","last_updated":"2025-02-26T11:10:48Z","snapshot_observed_at":"2026-08-14T23:16:37.529093Z","submitted_at":"2024-12-04T10:15:12Z","title":"Weighted-Reward Preference Optimization for Implicit Model Fusion","version":2},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-11T22:48:22.454900Z"},"links":{"citing_paper":"/paper/2412.03187"},"observation_digest":"sha256:fe3d63001f85e46d6a7a6d317ac7227a7b746f474f196f26cb862afd0d497c2d","observation_id":"6c75fea1-e282-4743-8301-7dbb6bd5d184","resolution":{"observed_at":"2026-08-11T22:48:22.454900Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:48:29.676645Z","title":"Branch-Train-MiX : Mixing expert LLM s into a mixture-of-experts LLM","venue":null,"work_id":"4974c5dd-4be4-4392-81e8-69074fe751e3","year":2024},"citing_paper":{"arxiv_id":"2412.03187","last_updated":"2025-02-26T11:10:48Z","snapshot_observed_at":"2026-08-14T23:16:37.529093Z","submitted_at":"2024-12-04T10:15:12Z","title":"Weighted-Reward Preference Optimization for Implicit Model Fusion","version":2},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-11T22:48:22.494850Z"},"links":{"citing_paper":"/paper/2412.03187"},"observation_digest":"sha256:ab0de94657e348fc70f5d9dab805f7d283b65049628e6cd59dc053731e804cc2","observation_id":"48ce57d4-346e-44b1-a248-00e74e220fa3","resolution":{"observed_at":"2026-08-11T22:48:29.725257Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:48:29.562608Z","title":"Preference fine-tuning of LLM s should leverage suboptimal, on-policy data","venue":null,"work_id":"f2f4eda2-0a68-4fb4-af40-6fbab3e20b8a","year":2024},"citing_paper":{"arxiv_id":"2412.03187","last_updated":"2025-02-26T11:10:48Z","snapshot_observed_at":"2026-08-14T23:16:37.529093Z","submitted_at":"2024-12-04T10:15:12Z","title":"Weighted-Reward Preference Optimization for Implicit Model Fusion","version":2},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-11T22:48:22.523428Z"},"links":{"citing_paper":"/paper/2412.03187"},"observation_digest":"sha256:9663669a3facf8e98e166862093e6d5a066dcbd0a6e4a9eeb7bf05a776f1cf3d","observation_id":"5cb99833-72f3-4def-964f-2e007264acdd","resolution":{"observed_at":"2026-08-11T22:48:29.594758Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.04616","last_updated":"2024-11-23T04:06:12Z","snapshot_observed_at":"2026-08-16T14:20:44.279177Z","submitted_at":"2024-02-07T06:48:24Z","title":"Beyond Answers: Transferring Reasoning Capabilities to Smaller LLMs Using Multi-Teacher Knowledge Distillation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.04616","snapshot_observed_at":"2026-08-11T22:48:22.572244Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.03187","last_updated":"2025-02-26T11:10:48Z","snapshot_observed_at":"2026-08-14T23:16:37.529093Z","submitted_at":"2024-12-04T10:15:12Z","title":"Weighted-Reward Preference Optimization for Implicit Model Fusion","version":2},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-11T22:48:22.572244Z"},"links":{"cited_paper":"/paper/2402.04616","citing_paper":"/paper/2412.03187"},"observation_digest":"sha256:fee5489ae8046417588121ef78160d3cfb2ea998bca42cba9d26559c7822eb26","observation_id":"53601485-ab76-4eb5-b01a-d99134fecfb9","resolution":{"observed_at":"2026-08-11T22:48:22.572244Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.16944","last_updated":"2023-10-25T19:25:16Z","snapshot_observed_at":"2026-08-15T09:26:05.847971Z","submitted_at":"2023-10-25T19:25:16Z","title":"Zephyr: Direct Distillation of LM Alignment","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.16944","snapshot_observed_at":"2026-08-11T22:48:22.611041Z","title":"Rush, and Thomas Wolf","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.03187","last_updated":"2025-02-26T11:10:48Z","snapshot_observed_at":"2026-08-14T23:16:37.529093Z","submitted_at":"2024-12-04T10:15:12Z","title":"Weighted-Reward Preference Optimization for Implicit Model Fusion","version":2},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-11T22:48:22.611041Z"},"links":{"cited_paper":"/paper/2310.16944","citing_paper":"/paper/2412.03187"},"observation_digest":"sha256:e3086fc9565d424c1e25b7c72cc851774d049b9f5c993cfbefe8be3021eee8e5","observation_id":"cbeb0572-5523-4118-999c-ed60c127d4cc","resolution":{"observed_at":"2026-08-11T22:48:22.611041Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:48:29.428349Z","title":"Knowledge fusion of large language models","venue":null,"work_id":"a07e6f39-d2f5-4140-b099-595a5d2017b4","year":2024},"citing_paper":{"arxiv_id":"2412.03187","last_updated":"2025-02-26T11:10:48Z","snapshot_observed_at":"2026-08-14T23:16:37.529093Z","submitted_at":"2024-12-04T10:15:12Z","title":"Weighted-Reward Preference Optimization for Implicit Model Fusion","version":2},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-11T22:48:22.639429Z"},"links":{"citing_paper":"/paper/2412.03187"},"observation_digest":"sha256:afcd674532f8ce6de301b4f5add0103734131dad3bb519f499d5174f95d9dc9c","observation_id":"db7ad270-3c0a-4181-bbf1-f9b9a35acae2","resolution":{"observed_at":"2026-08-11T22:48:29.458530Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.16107","last_updated":"2024-05-29T03:58:10Z","snapshot_observed_at":"2026-08-18T12:33:06.115169Z","submitted_at":"2024-02-25T15:11:58Z","title":"Knowledge Fusion of Chat LLMs: A Preliminary Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.16107","snapshot_observed_at":"2026-08-11T22:48:22.689153Z","title":"FuseChat : Knowledge fusion of chat models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.03187","last_updated":"2025-02-26T11:10:48Z","snapshot_observed_at":"2026-08-14T23:16:37.529093Z","submitted_at":"2024-12-04T10:15:12Z","title":"Weighted-Reward Preference Optimization for Implicit Model Fusion","version":2},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-11T22:48:22.689153Z"},"links":{"cited_paper":"/paper/2402.16107","citing_paper":"/paper/2412.03187"},"observation_digest":"sha256:84fa1149ee0aa7e466d38b2ed075462b2f6a7b408226df648a1f912424786f82","observation_id":"7a3dab9d-288c-4681-b7b4-7da070f5dcbd","resolution":{"observed_at":"2026-08-11T22:48:22.689153Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:48:29.173767Z","title":"Interpretable preferences via multi-objective reward modeling and mixture-of-experts","venue":null,"work_id":"b90c4d0d-b6a0-45aa-854a-03d50076051d","year":2024},"citing_paper":{"arxiv_id":"2412.03187","last_updated":"2025-02-26T11:10:48Z","snapshot_observed_at":"2026-08-14T23:16:37.529093Z","submitted_at":"2024-12-04T10:15:12Z","title":"Weighted-Reward Preference Optimization for Implicit Model Fusion","version":2},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-11T22:48:22.744765Z"},"links":{"citing_paper":"/paper/2412.03187"},"observation_digest":"sha256:9b036fee986be8551f3fb00aae0e013215baed3e024a8aa847b0828354c0b89d","observation_id":"b8f05aee-af0b-445f-8e51-f5f5f1d691e1","resolution":{"observed_at":"2026-08-11T22:48:29.307077Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04692","last_updated":"2024-06-07T07:04:10Z","snapshot_observed_at":"2026-08-13T12:11:51.471762Z","submitted_at":"2024-06-07T07:04:10Z","title":"Mixture-of-Agents Enhances Large Language Model Capabilities","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.04692","snapshot_observed_at":"2026-08-11T22:48:22.787258Z","title":"Mixture-of-Agents enhances large language model capabilities","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.03187","last_updated":"2025-02-26T11:10:48Z","snapshot_observed_at":"2026-08-14T23:16:37.529093Z","submitted_at":"2024-12-04T10:15:12Z","title":"Weighted-Reward Preference Optimization for Implicit Model Fusion","version":2},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-11T22:48:22.787258Z"},"links":{"cited_paper":"/paper/2406.04692","citing_paper":"/paper/2412.03187"},"observation_digest":"sha256:4d86b63f06b56192e1cc4940e80942fefd5cfb46c8617b95e265ee646a241283","observation_id":"2a071f56-a858-42a1-a01a-5fb58ae6dcfe","resolution":{"observed_at":"2026-08-11T22:48:22.787258Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.08673","last_updated":"2024-06-12T22:28:08Z","snapshot_observed_at":"2026-08-16T13:43:33.392971Z","submitted_at":"2024-06-12T22:28:08Z","title":"HelpSteer2: Open-source dataset for training top-performing reward models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.08673","snapshot_observed_at":"2026-08-11T22:48:22.834763Z","title":"HelpSteer2 : Open-source dataset for training top-performing reward models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.03187","last_updated":"2025-02-26T11:10:48Z","snapshot_observed_at":"2026-08-14T23:16:37.529093Z","submitted_at":"2024-12-04T10:15:12Z","title":"Weighted-Reward Preference Optimization for Implicit Model Fusion","version":2},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-11T22:48:22.834763Z"},"links":{"cited_paper":"/paper/2406.08673","citing_paper":"/paper/2412.03187"},"observation_digest":"sha256:9a784c13793d3ba7680316d0d66a7ca32f56a4f70c7d731b462f42a23d9e8d06","observation_id":"b8c57ab6-079c-48fc-8754-5faf0619f4f0","resolution":{"observed_at":"2026-08-11T22:48:22.834763Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:48:29.055304Z","title":"Model soups: averaging weights of multiple fine-tuned models improves accuracy without increasing inference time","venue":null,"work_id":"d59cb140-c08d-487f-9377-010716f77044","year":2022},"citing_paper":{"arxiv_id":"2412.03187","last_updated":"2025-02-26T11:10:48Z","snapshot_observed_at":"2026-08-14T23:16:37.529093Z","submitted_at":"2024-12-04T10:15:12Z","title":"Weighted-Reward Preference Optimization for Implicit Model Fusion","version":2},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-11T22:48:22.884755Z"},"links":{"citing_paper":"/paper/2412.03187"},"observation_digest":"sha256:f41b8a0612b94db4605cf84ef55069eae394bb7a66557c84104952fa2beb1155","observation_id":"4c16990f-2056-473d-8554-5e27ca8829b0","resolution":{"observed_at":"2026-08-11T22:48:29.104760Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:48:28.924963Z","title":"Contrastive preference optimization: Pushing the boundaries of LLM performance in machine translation","venue":null,"work_id":"d1f68615-4ca4-4e02-a9f4-c6930849424f","year":2024},"citing_paper":{"arxiv_id":"2412.03187","last_updated":"2025-02-26T11:10:48Z","snapshot_observed_at":"2026-08-14T23:16:37.529093Z","submitted_at":"2024-12-04T10:15:12Z","title":"Weighted-Reward Preference Optimization for Implicit Model Fusion","version":2},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-11T22:48:22.920817Z"},"links":{"citing_paper":"/paper/2412.03187"},"observation_digest":"sha256:67c5839a95fe37eab225684c36b40d3fbc01e17d995a66a269f37525d006f36b","observation_id":"508ae4d5-6415-4a6a-b645-a15ab15aebbd","resolution":{"observed_at":"2026-08-11T22:48:28.964747Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:48:28.751631Z","title":"Is DPO superior to PPO for LLM alignment? A comprehensive study","venue":null,"work_id":"fffb84bb-624d-463e-b516-765d1b53147e","year":2024},"citing_paper":{"arxiv_id":"2412.03187","last_updated":"2025-02-26T11:10:48Z","snapshot_observed_at":"2026-08-14T23:16:37.529093Z","submitted_at":"2024-12-04T10:15:12Z","title":"Weighted-Reward Preference Optimization for Implicit Model Fusion","version":2},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-11T22:48:22.954881Z"},"links":{"citing_paper":"/paper/2412.03187"},"observation_digest":"sha256:a631f3e2b77fac6189a3a37df144160bbe870e8ef06c49b1e20f5f2d18d3cc08","observation_id":"19a098c0-1432-4deb-aeb6-0f4256f4e83e","resolution":{"observed_at":"2026-08-11T22:48:28.804771Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:48:28.479739Z","title":"Bridging the gap between different vocabularies for llm ensemble","venue":null,"work_id":"515b7963-c2ac-4739-a066-008edf472f20","year":2024},"citing_paper":{"arxiv_id":"2412.03187","last_updated":"2025-02-26T11:10:48Z","snapshot_observed_at":"2026-08-14T23:16:37.529093Z","submitted_at":"2024-12-04T10:15:12Z","title":"Weighted-Reward Preference Optimization for Implicit Model Fusion","version":2},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-11T22:48:22.994861Z"},"links":{"citing_paper":"/paper/2412.03187"},"observation_digest":"sha256:89b48435a9d177c6e474b2553c31d62cae13a4dcf576f09c5d67391f92052fd4","observation_id":"003f0bc0-fab0-4a9b-99c9-63d6f8904f28","resolution":{"observed_at":"2026-08-11T22:48:28.614759Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:48:28.234895Z","title":"Ties-merging: Resolving interference when merging models","venue":null,"work_id":"3e866c11-5c0d-4c28-9e13-ba5996a7d173","year":2023},"citing_paper":{"arxiv_id":"2412.03187","last_updated":"2025-02-26T11:10:48Z","snapshot_observed_at":"2026-08-14T23:16:37.529093Z","submitted_at":"2024-12-04T10:15:12Z","title":"Weighted-Reward Preference Optimization for Implicit Model Fusion","version":2},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-11T22:48:23.025230Z"},"links":{"citing_paper":"/paper/2412.03187"},"observation_digest":"sha256:9e6feb42d3f89c3e4eaf9a5342ead10eb8a1eba8b0107a8eaec95e9305f10968","observation_id":"a8f40649-ac73-4eff-bd30-c88c3b870f7f","resolution":{"observed_at":"2026-08-11T22:48:28.334756Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.10671","last_updated":"2024-09-10T13:25:53Z","snapshot_observed_at":"2026-08-17T11:08:48.802438Z","submitted_at":"2024-07-15T12:35:42Z","title":"Qwen2 Technical Report","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.10671","snapshot_observed_at":"2026-08-11T22:48:23.061399Z","title":"Qwen2 technical report","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.03187","last_updated":"2025-02-26T11:10:48Z","snapshot_observed_at":"2026-08-14T23:16:37.529093Z","submitted_at":"2024-12-04T10:15:12Z","title":"Weighted-Reward Preference Optimization for Implicit Model Fusion","version":2},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-11T22:48:23.061399Z"},"links":{"cited_paper":"/paper/2407.10671","citing_paper":"/paper/2412.03187"},"observation_digest":"sha256:4873c5ae2fdc067fa087904c30b237db6b79cf6e66bd2d8920101ff5a85ab3e7","observation_id":"3a4784d0-ecf0-4726-ac29-9a011c6c8908","resolution":{"observed_at":"2026-08-11T22:48:23.061399Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.04652","last_updated":"2025-01-21T10:12:05Z","snapshot_observed_at":"2026-08-17T20:16:19.173618Z","submitted_at":"2024-03-07T16:52:49Z","title":"Yi: Open Foundation Models by 01.AI","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.04652","snapshot_observed_at":"2026-08-11T22:48:23.104877Z","title":"Yi: Open foundation models by 01.ai","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.03187","last_updated":"2025-02-26T11:10:48Z","snapshot_observed_at":"2026-08-14T23:16:37.529093Z","submitted_at":"2024-12-04T10:15:12Z","title":"Weighted-Reward Preference Optimization for Implicit Model Fusion","version":2},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-11T22:48:23.104877Z"},"links":{"cited_paper":"/paper/2403.04652","citing_paper":"/paper/2412.03187"},"observation_digest":"sha256:2c7992decb5f35320d9367eabe3b687f0c1fdfb1cd64a892262a39be96bc7bf8","observation_id":"05fdfed6-020a-4d50-a75c-2237f08eba29","resolution":{"observed_at":"2026-08-11T22:48:23.104877Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:48:28.041253Z","title":"RRHF : Rank responses to align language models with human feedback","venue":null,"work_id":"260cfd28-a14c-4c9a-b324-9d09eb551365","year":2023},"citing_paper":{"arxiv_id":"2412.03187","last_updated":"2025-02-26T11:10:48Z","snapshot_observed_at":"2026-08-14T23:16:37.529093Z","submitted_at":"2024-12-04T10:15:12Z","title":"Weighted-Reward Preference Optimization for Implicit Model Fusion","version":2},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-11T22:48:23.152469Z"},"links":{"citing_paper":"/paper/2412.03187"},"observation_digest":"sha256:8295e412faab308c98c9c8d8f78d305e053b8d50950f9bade9a019a138c91f05","observation_id":"a8510248-c7dd-4e51-9425-be56280da948","resolution":{"observed_at":"2026-08-11T22:48:28.062758Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:48:27.889904Z","title":"H ella S wag: Can a machine really finish your sentence? In Proceedings of the 57th Annual Meeting of the Association for Computational Linguistics, pp.\\ 4791--4800, 2019","venue":null,"work_id":"2a1b1fe8-925e-4f0a-8325-5a1b120a7985","year":2019},"citing_paper":{"arxiv_id":"2412.03187","last_updated":"2025-02-26T11:10:48Z","snapshot_observed_at":"2026-08-14T23:16:37.529093Z","submitted_at":"2024-12-04T10:15:12Z","title":"Weighted-Reward Preference Optimization for Implicit Model Fusion","version":2},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-11T22:48:23.214763Z"},"links":{"citing_paper":"/paper/2412.03187"},"observation_digest":"sha256:cafe4c8761f8072809b76c912b623a6be7920c0f955533f2bce15cd1dc13c437","observation_id":"7bc69922-b776-439d-84b2-10e5fb0a2e97","resolution":{"observed_at":"2026-08-11T22:48:27.924755Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.10425","last_updated":"2023-05-17T17:57:10Z","snapshot_observed_at":"2026-08-18T14:39:14.506293Z","submitted_at":"2023-05-17T17:57:10Z","title":"SLiC-HF: Sequence Likelihood Calibration with Human Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.10425","snapshot_observed_at":"2026-08-11T22:48:23.264757Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.03187","last_updated":"2025-02-26T11:10:48Z","snapshot_observed_at":"2026-08-14T23:16:37.529093Z","submitted_at":"2024-12-04T10:15:12Z","title":"Weighted-Reward Preference Optimization for Implicit Model Fusion","version":2},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-11T22:48:23.264757Z"},"links":{"cited_paper":"/paper/2305.10425","citing_paper":"/paper/2412.03187"},"observation_digest":"sha256:77eaff9cb32584da450807cde0fecfd2525f820237654cae2fb81955ab67f3bc","observation_id":"0f707a22-fc9c-4ed6-90c0-2268f4aafa11","resolution":{"observed_at":"2026-08-11T22:48:23.264757Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:48:27.737844Z","title":"Judging LLM -as-a-judge with MT-Bench and Chatbot Arena","venue":null,"work_id":"148eee38-34f5-4d4c-9475-dd2a5bbcb0e6","year":2023},"citing_paper":{"arxiv_id":"2412.03187","last_updated":"2025-02-26T11:10:48Z","snapshot_observed_at":"2026-08-14T23:16:37.529093Z","submitted_at":"2024-12-04T10:15:12Z","title":"Weighted-Reward Preference Optimization for Implicit Model Fusion","version":2},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-11T22:48:23.315428Z"},"links":{"citing_paper":"/paper/2412.03187"},"observation_digest":"sha256:7a806b4781e828f6882de018c2305ad80d531c657b146132e29494d2631f8713","observation_id":"73386b1e-aaac-4504-9d68-1da14a69894e","resolution":{"observed_at":"2026-08-11T22:48:27.787934Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:48:27.503023Z","title":"WPO : Enhancing RLHF with weighted preference optimization","venue":null,"work_id":"a2e88a72-996f-4da3-b13b-e86e38cb0d1a","year":2024},"citing_paper":{"arxiv_id":"2412.03187","last_updated":"2025-02-26T11:10:48Z","snapshot_observed_at":"2026-08-14T23:16:37.529093Z","submitted_at":"2024-12-04T10:15:12Z","title":"Weighted-Reward Preference Optimization for Implicit Model Fusion","version":2},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-11T22:48:23.365264Z"},"links":{"citing_paper":"/paper/2412.03187"},"observation_digest":"sha256:ef95db8b7baec3ecff007499f1ff1fdcdc743b158d6d0e2f9fc92b4992982a4b","observation_id":"a9eae4d2-50ac-4d9d-aaf1-130ba050a408","resolution":{"observed_at":"2026-08-11T22:48:27.584759Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:48:27.402051Z","title":"Starling-7B : Improving helpfulness and harmlessness with RLAIF","venue":null,"work_id":"7b273da6-70af-4ea2-b8c1-08a3da31a496","year":2024},"citing_paper":{"arxiv_id":"2412.03187","last_updated":"2025-02-26T11:10:48Z","snapshot_observed_at":"2026-08-14T23:16:37.529093Z","submitted_at":"2024-12-04T10:15:12Z","title":"Weighted-Reward Preference Optimization for Implicit Model Fusion","version":2},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-11T22:48:23.404759Z"},"links":{"citing_paper":"/paper/2412.03187"},"observation_digest":"sha256:bf709baa61d0cb659356fcf38da0f75aa4786112279178e6d16ad2d4029be615","observation_id":"f3890c95-d620-4ec9-8fb3-9e6d9cd8036f","resolution":{"observed_at":"2026-08-11T22:48:27.433540Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1909.08593","last_updated":"2020-01-08T23:02:36Z","snapshot_observed_at":"2026-08-16T00:15:57.597094Z","submitted_at":"2019-09-18T17:33:39Z","title":"Fine-Tuning Language Models from Human Preferences","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1909.08593","snapshot_observed_at":"2026-08-11T22:48:23.454765Z","title":"Ziegler, Nisan Stiennon, Jeff Wu, Tom B","venue":null,"work_id":null,"year":1909},"citing_paper":{"arxiv_id":"2412.03187","last_updated":"2025-02-26T11:10:48Z","snapshot_observed_at":"2026-08-14T23:16:37.529093Z","submitted_at":"2024-12-04T10:15:12Z","title":"Weighted-Reward Preference Optimization for Implicit Model Fusion","version":2},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-08-11T22:48:23.454765Z"},"links":{"cited_paper":"/paper/1909.08593","citing_paper":"/paper/2412.03187"},"observation_digest":"sha256:0f2c3dceea3a8add4ea2aef4eb6fbe2bc9c71b7bfbc4d5a63ebe5e3b0d27d42b","observation_id":"8fa8b405-7cdd-406c-857f-c41f0bfcb79f","resolution":{"observed_at":"2026-08-11T22:48:23.454765Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:48:23.495146Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.03187","last_updated":"2025-02-26T11:10:48Z","snapshot_observed_at":"2026-08-14T23:16:37.529093Z","submitted_at":"2024-12-04T10:15:12Z","title":"Weighted-Reward Preference Optimization for Implicit Model Fusion","version":2},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-08-11T22:48:23.495146Z"},"links":{"citing_paper":"/paper/2412.03187"},"observation_digest":"sha256:e59aec6fbe15d3502905e84354ae2d56475309e3dde31d840f532dcf0ce16f16","observation_id":"9ffb35a9-2081-4577-9e53-59e0adfdc756","resolution":{"observed_at":"2026-08-11T22:48:23.495146Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:48:23.526871Z","title":"@esa (Ref","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.03187","last_updated":"2025-02-26T11:10:48Z","snapshot_observed_at":"2026-08-14T23:16:37.529093Z","submitted_at":"2024-12-04T10:15:12Z","title":"Weighted-Reward Preference Optimization for Implicit Model Fusion","version":2},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-08-11T22:48:23.526871Z"},"links":{"citing_paper":"/paper/2412.03187"},"observation_digest":"sha256:6de88a3e62a768bb2879b8640146e61a14e55259a2c47c65bf993d50e7148085","observation_id":"16127d6e-d884-4d43-a4b4-7dfe77098d2b","resolution":{"observed_at":"2026-08-11T22:48:23.526871Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:48:23.574761Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.03187","last_updated":"2025-02-26T11:10:48Z","snapshot_observed_at":"2026-08-14T23:16:37.529093Z","submitted_at":"2024-12-04T10:15:12Z","title":"Weighted-Reward Preference Optimization for Implicit Model Fusion","version":2},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-08-11T22:48:23.574761Z"},"links":{"citing_paper":"/paper/2412.03187"},"observation_digest":"sha256:a0e5a4598665f8638ff7d330527c3c3a623c1a78755e369c25f72eeb74902f10","observation_id":"834b00d9-0ed4-4f10-a813-3308cfe5dc31","resolution":{"observed_at":"2026-08-11T22:48:23.574761Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:48:23.624843Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.03187","last_updated":"2025-02-26T11:10:48Z","snapshot_observed_at":"2026-08-14T23:16:37.529093Z","submitted_at":"2024-12-04T10:15:12Z","title":"Weighted-Reward Preference Optimization for Implicit Model Fusion","version":2},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-08-11T22:48:23.624843Z"},"links":{"citing_paper":"/paper/2412.03187"},"observation_digest":"sha256:08bd9d1645cabf1224ff049318ace3d78ab12c300a04cb40bc9ee0321ee0211e","observation_id":"18d18745-b8f2-4f41-94bf-afcf3eaf9f6e","resolution":{"observed_at":"2026-08-11T22:48:23.624843Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2412.03187","last_updated":"2025-02-26T11:10:48Z","latest_version":2,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-14T23:16:37.529093Z","submitted_at":"2024-12-04T10:15:12Z","title":"Weighted-Reward Preference Optimization for Implicit Model Fusion"},"reference_resolution":{"displayed":64,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":30,"verified_exact":0,"verified_fuzzy":34},"total_outbound_references":64},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"thesis":"As of 18 August 2026, this Paper Citation Record lists 64 of 64 outbound references and 2 inbound Pith citation observations for arXiv:2412.03187."}