{"as_of":"2026-08-19T13:20:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:077d6e40b6814b88a788d61e0801732cea7f184c732535d903677493a41b5f18","coverage":[{"denominator":167,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T14:57:54.027500Z","state":"measured"},{"denominator":100,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":100,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-19T06:32:44.657259+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2608.03092/citation-record","integrity":"/paper/2608.03092/integrity","json":"/paper/2608.03092/citation-record.json","paper":"/paper/2608.03092"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:57:53.692427Z","title":"Approximating","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03092","last_updated":"2026-08-04T04:08:08Z","snapshot_observed_at":"2026-08-18T00:47:09.893632Z","submitted_at":"2026-08-04T04:08:08Z","title":"SMOPD: Multi-Reward Reinforcement Learning via Specialize-and-Merge Online Policy Distillation","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-15T14:57:53.692427Z"},"links":{"citing_paper":"/paper/2608.03092"},"observation_digest":"sha256:271a70dacf7647ea8166ce14960bf0c469d97f84566a576dc9eac759eb3474ef","observation_id":"b44c3712-e4fb-4d25-b042-b058b40d0c96","resolution":{"observed_at":"2026-08-15T14:57:53.692427Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:57:53.697244Z","title":"Thinking Machines Lab: Connectionism , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03092","last_updated":"2026-08-04T04:08:08Z","snapshot_observed_at":"2026-08-18T00:47:09.893632Z","submitted_at":"2026-08-04T04:08:08Z","title":"SMOPD: Multi-Reward Reinforcement Learning via Specialize-and-Merge Online Policy Distillation","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-15T14:57:53.697244Z"},"links":{"citing_paper":"/paper/2608.03092"},"observation_digest":"sha256:279089107421cfa0c555de97abe5ed76ab7b72af79ae547703e0e791753d8797","observation_id":"9d978763-eb09-4404-ac3a-ea6d751c60d3","resolution":{"observed_at":"2026-08-15T14:57:53.697244Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2601.05242","last_updated":"2026-01-08T18:59:24Z","snapshot_observed_at":"2026-08-04T04:35:21.359264Z","submitted_at":"2026-01-08T18:59:24Z","title":"GDPO: Group reward-Decoupled Normalization Policy Optimization for Multi-reward RL Optimization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2601.05242","snapshot_observed_at":"2026-08-15T14:57:53.701026Z","title":"2601.05242 , archivePrefix=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03092","last_updated":"2026-08-04T04:08:08Z","snapshot_observed_at":"2026-08-18T00:47:09.893632Z","submitted_at":"2026-08-04T04:08:08Z","title":"SMOPD: Multi-Reward Reinforcement Learning via Specialize-and-Merge Online Policy Distillation","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-15T14:57:53.701026Z"},"links":{"cited_paper":"/paper/2601.05242","citing_paper":"/paper/2608.03092"},"observation_digest":"sha256:004fa30af8a83c86f315420bef57331d2c8951527a051cfe17dbd645582386d9","observation_id":"3bc3d340-d0ad-46f6-886e-05ad422f23b4","resolution":{"observed_at":"2026-08-15T14:57:53.701026Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-15T14:57:53.705018Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03092","last_updated":"2026-08-04T04:08:08Z","snapshot_observed_at":"2026-08-18T00:47:09.893632Z","submitted_at":"2026-08-04T04:08:08Z","title":"SMOPD: Multi-Reward Reinforcement Learning via Specialize-and-Merge Online Policy Distillation","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-15T14:57:53.705018Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2608.03092"},"observation_digest":"sha256:e41e470e4386296b96e5e225285a10aa4e72ae0f0eaa21c104e8031ac6901f4c","observation_id":"3f930e07-0f31-4a88-86bd-77b11984480b","resolution":{"observed_at":"2026-08-15T14:57:53.705018Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:57:53.708487Z","title":"2017 , eprint=","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2608.03092","last_updated":"2026-08-04T04:08:08Z","snapshot_observed_at":"2026-08-18T00:47:09.893632Z","submitted_at":"2026-08-04T04:08:08Z","title":"SMOPD: Multi-Reward Reinforcement Learning via Specialize-and-Merge Online Policy Distillation","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-15T14:57:53.708487Z"},"links":{"citing_paper":"/paper/2608.03092"},"observation_digest":"sha256:c83a941cbcd0dbd3e2f81d616e2eba46bce16a4e0a592c97fd145a1c4029da23","observation_id":"60b9bebc-e6c2-4376-a935-351d30f38d02","resolution":{"observed_at":"2026-08-15T14:57:53.708487Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:57:53.711697Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03092","last_updated":"2026-08-04T04:08:08Z","snapshot_observed_at":"2026-08-18T00:47:09.893632Z","submitted_at":"2026-08-04T04:08:08Z","title":"SMOPD: Multi-Reward Reinforcement Learning via Specialize-and-Merge Online Policy Distillation","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-15T14:57:53.711697Z"},"links":{"citing_paper":"/paper/2608.03092"},"observation_digest":"sha256:a7191a20d81d653fbaba545906999b12a647f38501a36944842347690d1e7048","observation_id":"b4b0f2f6-ed7b-432d-b120-1e6766403ba6","resolution":{"observed_at":"2026-08-15T14:57:53.711697Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:57:53.715648Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03092","last_updated":"2026-08-04T04:08:08Z","snapshot_observed_at":"2026-08-18T00:47:09.893632Z","submitted_at":"2026-08-04T04:08:08Z","title":"SMOPD: Multi-Reward Reinforcement Learning via Specialize-and-Merge Online Policy Distillation","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-15T14:57:53.715648Z"},"links":{"citing_paper":"/paper/2608.03092"},"observation_digest":"sha256:96ec9ffa21ccbc49b88bc6580cc9f2fac24acb04de55eeb4fd4b04ed46dbaf56","observation_id":"be70df40-b56d-4ea7-a077-17a1b2023331","resolution":{"observed_at":"2026-08-15T14:57:53.715648Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:57:53.719267Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03092","last_updated":"2026-08-04T04:08:08Z","snapshot_observed_at":"2026-08-18T00:47:09.893632Z","submitted_at":"2026-08-04T04:08:08Z","title":"SMOPD: Multi-Reward Reinforcement Learning via Specialize-and-Merge Online Policy Distillation","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-15T14:57:53.719267Z"},"links":{"citing_paper":"/paper/2608.03092"},"observation_digest":"sha256:e06d7362a4507519cc787a0cec78fe3363eaa46ee24e4e6ca749791811680730","observation_id":"f0787fa9-408b-4eb8-9531-1affac13a384","resolution":{"observed_at":"2026-08-15T14:57:53.719267Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:57:53.722363Z","title":"NIPS Deep Learning and Representation Learning Workshop , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03092","last_updated":"2026-08-04T04:08:08Z","snapshot_observed_at":"2026-08-18T00:47:09.893632Z","submitted_at":"2026-08-04T04:08:08Z","title":"SMOPD: Multi-Reward Reinforcement Learning via Specialize-and-Merge Online Policy Distillation","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-15T14:57:53.722363Z"},"links":{"citing_paper":"/paper/2608.03092"},"observation_digest":"sha256:a238b06fc20f482846e439e7536f6b2f2edddd680cd1d1b75e09155799ee8414","observation_id":"a31bca12-0bbb-4470-bd94-c9265e587d90","resolution":{"observed_at":"2026-08-15T14:57:53.722363Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:57:53.725125Z","title":"International Conference on Learning Representations (ICLR) , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03092","last_updated":"2026-08-04T04:08:08Z","snapshot_observed_at":"2026-08-18T00:47:09.893632Z","submitted_at":"2026-08-04T04:08:08Z","title":"SMOPD: Multi-Reward Reinforcement Learning via Specialize-and-Merge Online Policy Distillation","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-15T14:57:53.725125Z"},"links":{"citing_paper":"/paper/2608.03092"},"observation_digest":"sha256:e6f6ff4bf2fcc414c94f65fb2130dcd8f78de62b5f3afa6a8176eca1e6eb5dca","observation_id":"1c332071-41cd-4d27-a618-1b40ac4a1c61","resolution":{"observed_at":"2026-08-15T14:57:53.725125Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:57:53.728125Z","title":"Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03092","last_updated":"2026-08-04T04:08:08Z","snapshot_observed_at":"2026-08-18T00:47:09.893632Z","submitted_at":"2026-08-04T04:08:08Z","title":"SMOPD: Multi-Reward Reinforcement Learning via Specialize-and-Merge Online Policy Distillation","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-15T14:57:53.728125Z"},"links":{"citing_paper":"/paper/2608.03092"},"observation_digest":"sha256:128a51142b5d614572ca246188b130a365e0050e713e7568ef30ebf93bfe91aa","observation_id":"66007b7a-c580-4046-af05-70c4019a05ec","resolution":{"observed_at":"2026-08-15T14:57:53.728125Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:57:53.731053Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03092","last_updated":"2026-08-04T04:08:08Z","snapshot_observed_at":"2026-08-18T00:47:09.893632Z","submitted_at":"2026-08-04T04:08:08Z","title":"SMOPD: Multi-Reward Reinforcement Learning via Specialize-and-Merge Online Policy Distillation","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-15T14:57:53.731053Z"},"links":{"citing_paper":"/paper/2608.03092"},"observation_digest":"sha256:54d054dabbaf6782a215e2927fb8049ed1b684afaa32f4a3059b77b0543fb8d7","observation_id":"5e772e42-ca45-4703-972f-f65ccf585771","resolution":{"observed_at":"2026-08-15T14:57:53.731053Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:57:53.734494Z","title":"Proceedings of the 2016 Conference on Empirical Methods in Natural Language Processing (EMNLP) , pages=","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2608.03092","last_updated":"2026-08-04T04:08:08Z","snapshot_observed_at":"2026-08-18T00:47:09.893632Z","submitted_at":"2026-08-04T04:08:08Z","title":"SMOPD: Multi-Reward Reinforcement Learning via Specialize-and-Merge Online Policy Distillation","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-15T14:57:53.734494Z"},"links":{"citing_paper":"/paper/2608.03092"},"observation_digest":"sha256:75fae2ac71f6d79c7ce12bf3078027ade1debb704fce79f0bfaa1ffe827ab156","observation_id":"58fb0731-3699-499a-973e-7019f2ddc652","resolution":{"observed_at":"2026-08-15T14:57:53.734494Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:57:53.737879Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03092","last_updated":"2026-08-04T04:08:08Z","snapshot_observed_at":"2026-08-18T00:47:09.893632Z","submitted_at":"2026-08-04T04:08:08Z","title":"SMOPD: Multi-Reward Reinforcement Learning via Specialize-and-Merge Online Policy Distillation","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-15T14:57:53.737879Z"},"links":{"citing_paper":"/paper/2608.03092"},"observation_digest":"sha256:0baf88df6278ceb1fa413e524439b45e5507de151835e100cc91e585bc7a0fcf","observation_id":"301e8b44-978d-47bb-8ef6-e89e0d9de9b6","resolution":{"observed_at":"2026-08-15T14:57:53.737879Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:57:53.740548Z","title":"2026 , eprint=","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.03092","last_updated":"2026-08-04T04:08:08Z","snapshot_observed_at":"2026-08-18T00:47:09.893632Z","submitted_at":"2026-08-04T04:08:08Z","title":"SMOPD: Multi-Reward Reinforcement Learning via Specialize-and-Merge Online Policy Distillation","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-15T14:57:53.740548Z"},"links":{"citing_paper":"/paper/2608.03092"},"observation_digest":"sha256:93a2c26d7ea167e5010db7d2754cb930b1aca79a33db1eec879637c3e59b34b5","observation_id":"ea2d3af1-68aa-4862-81bf-184310a1320e","resolution":{"observed_at":"2026-08-15T14:57:53.740548Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2606.30406","last_updated":"2026-06-29T14:51:28Z","snapshot_observed_at":"2026-08-10T09:37:40.339025Z","submitted_at":"2026-06-29T14:51:28Z","title":"MOPD: Multi-Teacher On-Policy Distillation for Capability Integration in LLM Post-Training","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2606.30406","snapshot_observed_at":"2026-08-15T14:57:53.744202Z","title":"2606.30406 , archivePrefix=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03092","last_updated":"2026-08-04T04:08:08Z","snapshot_observed_at":"2026-08-18T00:47:09.893632Z","submitted_at":"2026-08-04T04:08:08Z","title":"SMOPD: Multi-Reward Reinforcement Learning via Specialize-and-Merge Online Policy Distillation","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-15T14:57:53.744202Z"},"links":{"cited_paper":"/paper/2606.30406","citing_paper":"/paper/2608.03092"},"observation_digest":"sha256:a3b7aaed1db3f5b2b0eecf64e3cf6276112acf4cb2819138612226d1a965bc78","observation_id":"7bffd4d0-e002-4b5a-8291-bc548fcdbf54","resolution":{"observed_at":"2026-08-15T14:57:53.744202Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:57:53.748401Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03092","last_updated":"2026-08-04T04:08:08Z","snapshot_observed_at":"2026-08-18T00:47:09.893632Z","submitted_at":"2026-08-04T04:08:08Z","title":"SMOPD: Multi-Reward Reinforcement Learning via Specialize-and-Merge Online Policy Distillation","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-15T14:57:53.748401Z"},"links":{"citing_paper":"/paper/2608.03092"},"observation_digest":"sha256:8de32dd5a8e032a9536d2c10fee8f644d7a82f3c8634a55d0673d132e01ce715","observation_id":"1e160db9-9907-4243-9747-5cd4c6284f54","resolution":{"observed_at":"2026-08-15T14:57:53.748401Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:57:53.751873Z","title":"Language Models are Super","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03092","last_updated":"2026-08-04T04:08:08Z","snapshot_observed_at":"2026-08-18T00:47:09.893632Z","submitted_at":"2026-08-04T04:08:08Z","title":"SMOPD: Multi-Reward Reinforcement Learning via Specialize-and-Merge Online Policy Distillation","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-15T14:57:53.751873Z"},"links":{"citing_paper":"/paper/2608.03092"},"observation_digest":"sha256:a25ee0366d8737e4e49ece6ab81dfd6e5c5a172b5f73f932376ef5dda9f6e20b","observation_id":"9981f875-77c8-4e0f-a65f-c41b1036962d","resolution":{"observed_at":"2026-08-15T14:57:53.751873Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:57:53.755666Z","title":"International Conference on Learning Representations (ICLR) , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03092","last_updated":"2026-08-04T04:08:08Z","snapshot_observed_at":"2026-08-18T00:47:09.893632Z","submitted_at":"2026-08-04T04:08:08Z","title":"SMOPD: Multi-Reward Reinforcement Learning via Specialize-and-Merge Online Policy Distillation","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-15T14:57:53.755666Z"},"links":{"citing_paper":"/paper/2608.03092"},"observation_digest":"sha256:984f8ae48799dc0975184389bf4c738e76927f4ff38a0bf1a1c0e9894d0062e2","observation_id":"f8609371-1e60-447a-afec-bf88a774d8f6","resolution":{"observed_at":"2026-08-15T14:57:53.755666Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:57:53.759548Z","title":"Proceedings of the 39th International Conference on Machine Learning (ICML) , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03092","last_updated":"2026-08-04T04:08:08Z","snapshot_observed_at":"2026-08-18T00:47:09.893632Z","submitted_at":"2026-08-04T04:08:08Z","title":"SMOPD: Multi-Reward Reinforcement Learning via Specialize-and-Merge Online Policy Distillation","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-15T14:57:53.759548Z"},"links":{"citing_paper":"/paper/2608.03092"},"observation_digest":"sha256:4d973f187fc5642ba547a00d03ced9cb0a7b2f0b5ad0406194ed429a4be94e45","observation_id":"d1c3a387-c06f-4e35-98e1-48f32b788dae","resolution":{"observed_at":"2026-08-15T14:57:53.759548Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.08073","last_updated":"2022-12-15T06:19:23Z","snapshot_observed_at":"2026-08-16T03:49:00.703994Z","submitted_at":"2022-12-15T06:19:23Z","title":"Constitutional AI: Harmlessness from AI Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.08073","snapshot_observed_at":"2026-08-15T14:57:53.762569Z","title":"Constitutional","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03092","last_updated":"2026-08-04T04:08:08Z","snapshot_observed_at":"2026-08-18T00:47:09.893632Z","submitted_at":"2026-08-04T04:08:08Z","title":"SMOPD: Multi-Reward Reinforcement Learning via Specialize-and-Merge Online Policy Distillation","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-15T14:57:53.762569Z"},"links":{"cited_paper":"/paper/2212.08073","citing_paper":"/paper/2608.03092"},"observation_digest":"sha256:463306eab2b78a1ed2e52d741e7c0baeaa385854fcb1606e68807cba8616b99e","observation_id":"1bb26a02-3136-4743-be38-7b335f5a47f4","resolution":{"observed_at":"2026-08-15T14:57:53.762569Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:57:53.765987Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03092","last_updated":"2026-08-04T04:08:08Z","snapshot_observed_at":"2026-08-18T00:47:09.893632Z","submitted_at":"2026-08-04T04:08:08Z","title":"SMOPD: Multi-Reward Reinforcement Learning via Specialize-and-Merge Online Policy Distillation","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-15T14:57:53.765987Z"},"links":{"citing_paper":"/paper/2608.03092"},"observation_digest":"sha256:b88a6237549143a48e1b682b4f20396138c52bf3243411ac41324847a2c704fb","observation_id":"e55ff134-a8c9-4fef-be53-5822847b22cf","resolution":{"observed_at":"2026-08-15T14:57:53.765987Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:57:53.769326Z","title":"2022 , eprint=","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.03092","last_updated":"2026-08-04T04:08:08Z","snapshot_observed_at":"2026-08-18T00:47:09.893632Z","submitted_at":"2026-08-04T04:08:08Z","title":"SMOPD: Multi-Reward Reinforcement Learning via Specialize-and-Merge Online Policy Distillation","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-15T14:57:53.769326Z"},"links":{"citing_paper":"/paper/2608.03092"},"observation_digest":"sha256:d78a2b91239b02d5641c66667037dc5efdea84b735d616ea26e068dc39891e61","observation_id":"f469fe5c-7c2f-4362-a77f-f9cb0ec5a8f0","resolution":{"observed_at":"2026-08-15T14:57:53.769326Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:57:53.772522Z","title":"Hashimoto , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03092","last_updated":"2026-08-04T04:08:08Z","snapshot_observed_at":"2026-08-18T00:47:09.893632Z","submitted_at":"2026-08-04T04:08:08Z","title":"SMOPD: Multi-Reward Reinforcement Learning via Specialize-and-Merge Online Policy Distillation","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-15T14:57:53.772522Z"},"links":{"citing_paper":"/paper/2608.03092"},"observation_digest":"sha256:6b56c6ebb78dfb484a57c439daf093011ba9c0166e73f6096f3d8dabb0131362","observation_id":"2a04f551-0c78-48aa-bcd0-2e3b1650c66a","resolution":{"observed_at":"2026-08-15T14:57:53.772522Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:57:53.775564Z","title":"Arithmetic Control of","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03092","last_updated":"2026-08-04T04:08:08Z","snapshot_observed_at":"2026-08-18T00:47:09.893632Z","submitted_at":"2026-08-04T04:08:08Z","title":"SMOPD: Multi-Reward Reinforcement Learning via Specialize-and-Merge Online Policy Distillation","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-15T14:57:53.775564Z"},"links":{"citing_paper":"/paper/2608.03092"},"observation_digest":"sha256:bc55395e66b092b936c89563ab63657a9b6e8659bc08fc45d7d2d9f4c6c04010","observation_id":"8a5ba99a-6b97-4694-a945-a9535aee84ac","resolution":{"observed_at":"2026-08-15T14:57:53.775564Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:57:53.779097Z","title":"Rewarded soups: towards","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03092","last_updated":"2026-08-04T04:08:08Z","snapshot_observed_at":"2026-08-18T00:47:09.893632Z","submitted_at":"2026-08-04T04:08:08Z","title":"SMOPD: Multi-Reward Reinforcement Learning via Specialize-and-Merge Online Policy Distillation","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-15T14:57:53.779097Z"},"links":{"citing_paper":"/paper/2608.03092"},"observation_digest":"sha256:2f053c16181a8134fd7bea9f86d53e353a2d4cdb95ea715a18715dc392d8f418","observation_id":"9c6e0cdb-3ef0-409f-b06d-7d3837124cd8","resolution":{"observed_at":"2026-08-15T14:57:53.779097Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:57:53.782265Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03092","last_updated":"2026-08-04T04:08:08Z","snapshot_observed_at":"2026-08-18T00:47:09.893632Z","submitted_at":"2026-08-04T04:08:08Z","title":"SMOPD: Multi-Reward Reinforcement Learning via Specialize-and-Merge Online Policy Distillation","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-15T14:57:53.782265Z"},"links":{"citing_paper":"/paper/2608.03092"},"observation_digest":"sha256:34dbab839895a0483fb511a30e37f7ea1a4f0c3bc279ce07648e9d050498308c","observation_id":"5911d5ed-af19-4c20-99d2-f54f52ae8c3a","resolution":{"observed_at":"2026-08-15T14:57:53.782265Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:57:53.785597Z","title":"Back to Basics: Revisiting","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03092","last_updated":"2026-08-04T04:08:08Z","snapshot_observed_at":"2026-08-18T00:47:09.893632Z","submitted_at":"2026-08-04T04:08:08Z","title":"SMOPD: Multi-Reward Reinforcement Learning via Specialize-and-Merge Online Policy Distillation","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-15T14:57:53.785597Z"},"links":{"citing_paper":"/paper/2608.03092"},"observation_digest":"sha256:38f8a68789fbb7e248074a02225fdb5df218b834cb5e114fd9fa2479329f9c1f","observation_id":"55315f55-352e-45fb-92d4-c8072d293dd1","resolution":{"observed_at":"2026-08-15T14:57:53.785597Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:57:53.788532Z","title":"2025 , eprint=","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.03092","last_updated":"2026-08-04T04:08:08Z","snapshot_observed_at":"2026-08-18T00:47:09.893632Z","submitted_at":"2026-08-04T04:08:08Z","title":"SMOPD: Multi-Reward Reinforcement Learning via Specialize-and-Merge Online Policy Distillation","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-15T14:57:53.788532Z"},"links":{"citing_paper":"/paper/2608.03092"},"observation_digest":"sha256:d2ff193a4ba495722be35ba857471c07dd574f05d5e1e224d42839c9db560178","observation_id":"e845bf90-36b6-4458-8001-5b3997453d2c","resolution":{"observed_at":"2026-08-15T14:57:53.788532Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2606.16771","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:57:54.683213Z","title":"2606.16771 , archivePrefix=","venue":null,"work_id":"100b07fa-5cd4-4a6c-ae2a-a7c21a6a84f5","year":null},"citing_paper":{"arxiv_id":"2608.03092","last_updated":"2026-08-04T04:08:08Z","snapshot_observed_at":"2026-08-18T00:47:09.893632Z","submitted_at":"2026-08-04T04:08:08Z","title":"SMOPD: Multi-Reward Reinforcement Learning via Specialize-and-Merge Online Policy Distillation","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-15T14:57:53.791392Z"},"links":{"citing_paper":"/paper/2608.03092"},"observation_digest":"sha256:17933a3f654eba203daff70dde0d52c38ed2d05109af7cdb713247d69e2a3394","observation_id":"f21dcfbf-6f20-4b6c-b3b0-a49a4d561e47","resolution":{"observed_at":"2026-08-15T14:57:54.687922Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2605.25604","last_updated":"2026-05-25T08:55:16Z","snapshot_observed_at":"2026-08-13T02:57:08.151274Z","submitted_at":"2026-05-25T08:55:16Z","title":"DVAO: Dynamic Variance-adaptive Advantage Optimization for Multi-reward Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2605.25604","doi":null,"metadata_source":"pith","pith_arxiv_id":"2605.25604","snapshot_observed_at":"2026-08-15T14:57:54.630924Z","title":"DVAO: Dynamic Variance-adaptive Advantage Optimization for Multi-reward Reinforcement Learning","venue":"cs.CL","work_id":"df5e53f5-3062-46e7-b311-9b203fc04d09","year":2026},"citing_paper":{"arxiv_id":"2608.03092","last_updated":"2026-08-04T04:08:08Z","snapshot_observed_at":"2026-08-18T00:47:09.893632Z","submitted_at":"2026-08-04T04:08:08Z","title":"SMOPD: Multi-Reward Reinforcement Learning via Specialize-and-Merge Online Policy Distillation","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-15T14:57:53.794931Z"},"links":{"cited_paper":"/paper/2605.25604","citing_paper":"/paper/2608.03092"},"observation_digest":"sha256:d13149acc10c6c5e85ce8c354a8bbd4ddc0e2c3652cd27092dca5370495920b6","observation_id":"a56a4a33-f71d-4464-8afd-e78f8f8071ad","resolution":{"observed_at":"2026-08-15T14:57:54.634427Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:57:53.799215Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03092","last_updated":"2026-08-04T04:08:08Z","snapshot_observed_at":"2026-08-18T00:47:09.893632Z","submitted_at":"2026-08-04T04:08:08Z","title":"SMOPD: Multi-Reward Reinforcement Learning via Specialize-and-Merge Online Policy Distillation","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-15T14:57:53.799215Z"},"links":{"citing_paper":"/paper/2608.03092"},"observation_digest":"sha256:e8bcd8e6c00dedf38123f36dde3fd9de1c992bde477f2404a5409bca778fb72c","observation_id":"947a9e8c-6c31-4e97-b98e-94b3b52ea8b0","resolution":{"observed_at":"2026-08-15T14:57:53.799215Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:57:53.802430Z","title":"2024 , eprint=","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.03092","last_updated":"2026-08-04T04:08:08Z","snapshot_observed_at":"2026-08-18T00:47:09.893632Z","submitted_at":"2026-08-04T04:08:08Z","title":"SMOPD: Multi-Reward Reinforcement Learning via Specialize-and-Merge Online Policy Distillation","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-15T14:57:53.802430Z"},"links":{"citing_paper":"/paper/2608.03092"},"observation_digest":"sha256:88d92b3c11f9793e0d4eab20fee0b2803c97d5871363546e2d504cfd640aab06","observation_id":"56257440-42c7-4d8e-8768-c59fd0c926f5","resolution":{"observed_at":"2026-08-15T14:57:53.802430Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:57:53.806791Z","title":"2024 , eprint=","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.03092","last_updated":"2026-08-04T04:08:08Z","snapshot_observed_at":"2026-08-18T00:47:09.893632Z","submitted_at":"2026-08-04T04:08:08Z","title":"SMOPD: Multi-Reward Reinforcement Learning via Specialize-and-Merge Online Policy Distillation","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-15T14:57:53.806791Z"},"links":{"citing_paper":"/paper/2608.03092"},"observation_digest":"sha256:c62de190bc9d5f1a888a46b6472486bfda70b039940412a69bf058cb2865d019","observation_id":"60362f9e-c83b-4f2e-b4c4-f50e93c95758","resolution":{"observed_at":"2026-08-15T14:57:53.806791Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:57:53.809737Z","title":"Gonzalez and Hao Zhang and Ion Stoica , booktitle=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03092","last_updated":"2026-08-04T04:08:08Z","snapshot_observed_at":"2026-08-18T00:47:09.893632Z","submitted_at":"2026-08-04T04:08:08Z","title":"SMOPD: Multi-Reward Reinforcement Learning via Specialize-and-Merge Online Policy Distillation","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-15T14:57:53.809737Z"},"links":{"citing_paper":"/paper/2608.03092"},"observation_digest":"sha256:5a39e3904188a733d41a0886c42eb6469f665bb3c587bcd1578d4b02bb107a33","observation_id":"1355564d-ac98-4810-a57f-0b906cb5eace","resolution":{"observed_at":"2026-08-15T14:57:53.809737Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:57:53.813058Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03092","last_updated":"2026-08-04T04:08:08Z","snapshot_observed_at":"2026-08-18T00:47:09.893632Z","submitted_at":"2026-08-04T04:08:08Z","title":"SMOPD: Multi-Reward Reinforcement Learning via Specialize-and-Merge Online Policy Distillation","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-15T14:57:53.813058Z"},"links":{"citing_paper":"/paper/2608.03092"},"observation_digest":"sha256:15f8ea6b4df369e77a4d54628893ca7330778d680862cf95c815039f620700b5","observation_id":"2dab2f60-a705-448b-a87e-589b931b20b9","resolution":{"observed_at":"2026-08-15T14:57:53.813058Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:57:53.816389Z","title":"Patil and Tianjun Zhang and Xin Wang and Joseph E","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03092","last_updated":"2026-08-04T04:08:08Z","snapshot_observed_at":"2026-08-18T00:47:09.893632Z","submitted_at":"2026-08-04T04:08:08Z","title":"SMOPD: Multi-Reward Reinforcement Learning via Specialize-and-Merge Online Policy Distillation","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-15T14:57:53.816389Z"},"links":{"citing_paper":"/paper/2608.03092"},"observation_digest":"sha256:8843918a2c9732b7e89c844e4fee48296293e3ce94cd51208d845253defeba3f","observation_id":"b3971191-ef85-4ff8-b1c6-f11cee07edff","resolution":{"observed_at":"2026-08-15T14:57:53.816389Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:57:53.820297Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03092","last_updated":"2026-08-04T04:08:08Z","snapshot_observed_at":"2026-08-18T00:47:09.893632Z","submitted_at":"2026-08-04T04:08:08Z","title":"SMOPD: Multi-Reward Reinforcement Learning via Specialize-and-Merge Online Policy Distillation","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-15T14:57:53.820297Z"},"links":{"citing_paper":"/paper/2608.03092"},"observation_digest":"sha256:2159a80fa5b940bc4271c52f4d5ce69a0b3481d7aa172e5086c6263b6481b03e","observation_id":"eb7f4ffe-1f1a-4a0c-9444-fbd9de0231a0","resolution":{"observed_at":"2026-08-15T14:57:53.820297Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:57:53.823262Z","title":"Findings of the Association for Computational Linguistics: EMNLP 2024 , pages=","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.03092","last_updated":"2026-08-04T04:08:08Z","snapshot_observed_at":"2026-08-18T00:47:09.893632Z","submitted_at":"2026-08-04T04:08:08Z","title":"SMOPD: Multi-Reward Reinforcement Learning via Specialize-and-Merge Online Policy Distillation","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-15T14:57:53.823262Z"},"links":{"citing_paper":"/paper/2608.03092"},"observation_digest":"sha256:2d0086b9ef09dd257f259c26c0fd8c6b9e3f75422e05ee2821e9fe0b8d831ebb","observation_id":"d237aab3-d2f0-45e2-8d98-a83959f16682","resolution":{"observed_at":"2026-08-15T14:57:53.823262Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2606.07705","last_updated":"2026-06-05T10:00:19Z","snapshot_observed_at":"2026-08-03T12:09:42.759574Z","submitted_at":"2026-06-05T10:00:19Z","title":"SAW: Stage-Aware Dynamic Weighting for Multi-Objective Reinforcement Learning in Large Language Models","version":1},"cited_work":{"arxiv_id":"2606.07705","doi":null,"metadata_source":"pith","pith_arxiv_id":"2606.07705","snapshot_observed_at":"2026-08-15T14:57:54.615752Z","title":"SAW: Stage-Aware Dynamic Weighting for Multi-Objective Reinforcement Learning in Large Language Models","venue":"cs.LG","work_id":"a217619d-e951-47cd-8927-1939dc6ab509","year":2026},"citing_paper":{"arxiv_id":"2608.03092","last_updated":"2026-08-04T04:08:08Z","snapshot_observed_at":"2026-08-18T00:47:09.893632Z","submitted_at":"2026-08-04T04:08:08Z","title":"SMOPD: Multi-Reward Reinforcement Learning via Specialize-and-Merge Online Policy Distillation","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-15T14:57:53.826235Z"},"links":{"cited_paper":"/paper/2606.07705","citing_paper":"/paper/2608.03092"},"observation_digest":"sha256:0be62b304895d05944328cf6f46e8c8519005ea1bb9b96dcf5cb8af9a5f7e512","observation_id":"a9c73846-1a10-4f50-9319-e3fb17d0e450","resolution":{"observed_at":"2026-08-15T14:57:54.619457Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.20370","last_updated":"2024-09-30T15:06:53Z","snapshot_observed_at":"2026-08-16T13:14:05.762847Z","submitted_at":"2024-09-30T15:06:53Z","title":"The Perfect Blend: Redefining RLHF with Mixture of Judges","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.20370","snapshot_observed_at":"2026-08-15T14:57:53.831378Z","title":"The Perfect Blend: Redefining","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03092","last_updated":"2026-08-04T04:08:08Z","snapshot_observed_at":"2026-08-18T00:47:09.893632Z","submitted_at":"2026-08-04T04:08:08Z","title":"SMOPD: Multi-Reward Reinforcement Learning via Specialize-and-Merge Online Policy Distillation","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-15T14:57:53.831378Z"},"links":{"cited_paper":"/paper/2409.20370","citing_paper":"/paper/2608.03092"},"observation_digest":"sha256:3865942a96153e2356a8e9ce29baac011d32486432f1957eb9891c6b8f67b25d","observation_id":"5f1707d8-0451-4278-be2d-ea5f5f65f148","resolution":{"observed_at":"2026-08-15T14:57:53.831378Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:57:53.836395Z","title":"International Conference on Learning Representations (ICLR) , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03092","last_updated":"2026-08-04T04:08:08Z","snapshot_observed_at":"2026-08-18T00:47:09.893632Z","submitted_at":"2026-08-04T04:08:08Z","title":"SMOPD: Multi-Reward Reinforcement Learning via Specialize-and-Merge Online Policy Distillation","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-15T14:57:53.836395Z"},"links":{"citing_paper":"/paper/2608.03092"},"observation_digest":"sha256:817c9fe86af7c7b30fe19cb402c84c96a663f8acb968dc5988a7890375f53657","observation_id":"7100e852-0073-42bc-9aef-0a21d22ff9ef","resolution":{"observed_at":"2026-08-15T14:57:53.836395Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16768","last_updated":"2024-06-24T16:24:34Z","snapshot_observed_at":"2026-08-16T13:40:04.078262Z","submitted_at":"2024-06-24T16:24:34Z","title":"WARP: On the Benefits of Weight Averaged Rewarded Policies","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.16768","snapshot_observed_at":"2026-08-15T14:57:53.839991Z","title":"2406.16768 , archivePrefix=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03092","last_updated":"2026-08-04T04:08:08Z","snapshot_observed_at":"2026-08-18T00:47:09.893632Z","submitted_at":"2026-08-04T04:08:08Z","title":"SMOPD: Multi-Reward Reinforcement Learning via Specialize-and-Merge Online Policy Distillation","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-15T14:57:53.839991Z"},"links":{"cited_paper":"/paper/2406.16768","citing_paper":"/paper/2608.03092"},"observation_digest":"sha256:302a6656f63163baf54d0e5983f0626b2803e87a95a407d1848d62e9db6c8415","observation_id":"458571d0-4753-49b3-bc5e-b90ebef85fe3","resolution":{"observed_at":"2026-08-15T14:57:53.839991Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:57:53.843008Z","title":"Findings of the Association for Computational Linguistics: ACL 2024 , year=","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.03092","last_updated":"2026-08-04T04:08:08Z","snapshot_observed_at":"2026-08-18T00:47:09.893632Z","submitted_at":"2026-08-04T04:08:08Z","title":"SMOPD: Multi-Reward Reinforcement Learning via Specialize-and-Merge Online Policy Distillation","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-15T14:57:53.843008Z"},"links":{"citing_paper":"/paper/2608.03092"},"observation_digest":"sha256:c394b6fd394572cd3606cd236ac63aea87d39ed3364bcdf1c0b8e89d49aca8bf","observation_id":"b74d5406-0524-46d2-8a75-34d0a3b1ce8c","resolution":{"observed_at":"2026-08-15T14:57:53.843008Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:57:53.846073Z","title":"Singh and DJ Strouse and Tuomas Sandholm and Ruslan Salakhutdinov and Anca D","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03092","last_updated":"2026-08-04T04:08:08Z","snapshot_observed_at":"2026-08-18T00:47:09.893632Z","submitted_at":"2026-08-04T04:08:08Z","title":"SMOPD: Multi-Reward Reinforcement Learning via Specialize-and-Merge Online Policy Distillation","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-15T14:57:53.846073Z"},"links":{"citing_paper":"/paper/2608.03092"},"observation_digest":"sha256:83c7f250bb3d7b4bcc1528778e85990255c53171d9b8a2e20e25e167b98fa75c","observation_id":"52d38c34-105f-4271-84ec-e8728d765d87","resolution":{"observed_at":"2026-08-15T14:57:53.846073Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:57:53.848979Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03092","last_updated":"2026-08-04T04:08:08Z","snapshot_observed_at":"2026-08-18T00:47:09.893632Z","submitted_at":"2026-08-04T04:08:08Z","title":"SMOPD: Multi-Reward Reinforcement Learning via Specialize-and-Merge Online Policy Distillation","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-15T14:57:53.848979Z"},"links":{"citing_paper":"/paper/2608.03092"},"observation_digest":"sha256:4a107adc4fb09596082448f396c510df667094088469d56b6c592402217c9480","observation_id":"4a920b9b-be2f-48cc-8f55-8369bda27d7d","resolution":{"observed_at":"2026-08-15T14:57:53.848979Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:57:53.851928Z","title":"2025 , doi=","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.03092","last_updated":"2026-08-04T04:08:08Z","snapshot_observed_at":"2026-08-18T00:47:09.893632Z","submitted_at":"2026-08-04T04:08:08Z","title":"SMOPD: Multi-Reward Reinforcement Learning via Specialize-and-Merge Online Policy Distillation","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-15T14:57:53.851928Z"},"links":{"citing_paper":"/paper/2608.03092"},"observation_digest":"sha256:ded5ce42c63b7c86eed6660925c659aa9357fdd1ea82c0cf583fa36454d61946","observation_id":"42b17cf8-95dd-4af2-a4f0-cf5d12562fa7","resolution":{"observed_at":"2026-08-15T14:57:53.851928Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:57:53.855105Z","title":"2021 , eprint=","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.03092","last_updated":"2026-08-04T04:08:08Z","snapshot_observed_at":"2026-08-18T00:47:09.893632Z","submitted_at":"2026-08-04T04:08:08Z","title":"SMOPD: Multi-Reward Reinforcement Learning via Specialize-and-Merge Online Policy Distillation","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-15T14:57:53.855105Z"},"links":{"citing_paper":"/paper/2608.03092"},"observation_digest":"sha256:474e52e576f797735e55d505680ebe8c99c7315e60f4e3f9ab2149105fc0cc7a","observation_id":"910b124d-5a82-4792-b21f-92dba7479cf3","resolution":{"observed_at":"2026-08-15T14:57:53.855105Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:57:53.858442Z","title":"Measuring Mathematical Problem Solving With the","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03092","last_updated":"2026-08-04T04:08:08Z","snapshot_observed_at":"2026-08-18T00:47:09.893632Z","submitted_at":"2026-08-04T04:08:08Z","title":"SMOPD: Multi-Reward Reinforcement Learning via Specialize-and-Merge Online Policy Distillation","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-15T14:57:53.858442Z"},"links":{"citing_paper":"/paper/2608.03092"},"observation_digest":"sha256:754342d8623c213f96393d2746823679c3ccd0a404a86df0ac57d75e3fc54fac","observation_id":"b66bf340-d024-4cef-9b55-5130159e6940","resolution":{"observed_at":"2026-08-15T14:57:53.858442Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:57:53.861265Z","title":"2019 , eprint=","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2608.03092","last_updated":"2026-08-04T04:08:08Z","snapshot_observed_at":"2026-08-18T00:47:09.893632Z","submitted_at":"2026-08-04T04:08:08Z","title":"SMOPD: Multi-Reward Reinforcement Learning via Specialize-and-Merge Online Policy Distillation","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-15T14:57:53.861265Z"},"links":{"citing_paper":"/paper/2608.03092"},"observation_digest":"sha256:e38801db73aa42138cf0157fcf3dd9cff4d0fcec06b006720460a8a956f1b1d5","observation_id":"7d649c44-756f-4c84-8759-1a43d032246e","resolution":{"observed_at":"2026-08-15T14:57:53.861265Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:57:53.864101Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03092","last_updated":"2026-08-04T04:08:08Z","snapshot_observed_at":"2026-08-18T00:47:09.893632Z","submitted_at":"2026-08-04T04:08:08Z","title":"SMOPD: Multi-Reward Reinforcement Learning via Specialize-and-Merge Online Policy Distillation","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-15T14:57:53.864101Z"},"links":{"citing_paper":"/paper/2608.03092"},"observation_digest":"sha256:c3f85a1b6aa77ac0916280dfbee31322de2111b506c11feeca40672ff26fc8a4","observation_id":"739164c7-0b3f-434f-b1dd-9d7647fb01c4","resolution":{"observed_at":"2026-08-15T14:57:53.864101Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:57:53.867436Z","title":"International Conference on Machine Learning , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03092","last_updated":"2026-08-04T04:08:08Z","snapshot_observed_at":"2026-08-18T00:47:09.893632Z","submitted_at":"2026-08-04T04:08:08Z","title":"SMOPD: Multi-Reward Reinforcement Learning via Specialize-and-Merge Online Policy Distillation","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-15T14:57:53.867436Z"},"links":{"citing_paper":"/paper/2608.03092"},"observation_digest":"sha256:c5828c8bd34ff1c24618d956f100f292e5780779ec7a7f05a1986be6202e0269","observation_id":"933ed797-10b5-4678-bba9-08d2b4935b00","resolution":{"observed_at":"2026-08-15T14:57:53.867436Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:57:53.871011Z","title":"Proceedings of the 61st Annual Meeting of the Association for Computational Linguistics , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03092","last_updated":"2026-08-04T04:08:08Z","snapshot_observed_at":"2026-08-18T00:47:09.893632Z","submitted_at":"2026-08-04T04:08:08Z","title":"SMOPD: Multi-Reward Reinforcement Learning via Specialize-and-Merge Online Policy Distillation","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-15T14:57:53.871011Z"},"links":{"citing_paper":"/paper/2608.03092"},"observation_digest":"sha256:5d2c9f9947b2fa9328c4f06ce9282ebaac2d8611cacdc0f51d5c66b63c9966b5","observation_id":"4c6525fa-6a6e-43e7-b798-c2b3bd17038b","resolution":{"observed_at":"2026-08-15T14:57:53.871011Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:57:53.875132Z","title":"2026 , eprint=","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.03092","last_updated":"2026-08-04T04:08:08Z","snapshot_observed_at":"2026-08-18T00:47:09.893632Z","submitted_at":"2026-08-04T04:08:08Z","title":"SMOPD: Multi-Reward Reinforcement Learning via Specialize-and-Merge Online Policy Distillation","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-15T14:57:53.875132Z"},"links":{"citing_paper":"/paper/2608.03092"},"observation_digest":"sha256:e3b5ad684b2506115f1fb663207fe9e7629b98db10d61d80321077efe1f27d78","observation_id":"53692ec1-9980-46a6-ac36-d69d18c923d9","resolution":{"observed_at":"2026-08-15T14:57:53.875132Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:57:53.878335Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03092","last_updated":"2026-08-04T04:08:08Z","snapshot_observed_at":"2026-08-18T00:47:09.893632Z","submitted_at":"2026-08-04T04:08:08Z","title":"SMOPD: Multi-Reward Reinforcement Learning via Specialize-and-Merge Online Policy Distillation","version":1},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-15T14:57:53.878335Z"},"links":{"citing_paper":"/paper/2608.03092"},"observation_digest":"sha256:ce218c4cd18f2ceb0e7e973cdf642f250aa481ef16af1df679f5feb475da3f6b","observation_id":"bc3c0ad2-cb95-434c-b0b0-3abcff808756","resolution":{"observed_at":"2026-08-15T14:57:53.878335Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:57:53.882201Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03092","last_updated":"2026-08-04T04:08:08Z","snapshot_observed_at":"2026-08-18T00:47:09.893632Z","submitted_at":"2026-08-04T04:08:08Z","title":"SMOPD: Multi-Reward Reinforcement Learning via Specialize-and-Merge Online Policy Distillation","version":1},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-15T14:57:53.882201Z"},"links":{"citing_paper":"/paper/2608.03092"},"observation_digest":"sha256:b87f30234a1cd4441594c72b2c943ea2fd2a6c21fc8cc446485e02ac4cae749d","observation_id":"1506ac23-0a71-46b5-a02c-d10d8f928cfd","resolution":{"observed_at":"2026-08-15T14:57:53.882201Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:57:53.885627Z","title":"Gonzalez and Ion Stoica , booktitle=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03092","last_updated":"2026-08-04T04:08:08Z","snapshot_observed_at":"2026-08-18T00:47:09.893632Z","submitted_at":"2026-08-04T04:08:08Z","title":"SMOPD: Multi-Reward Reinforcement Learning via Specialize-and-Merge Online Policy Distillation","version":1},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-15T14:57:53.885627Z"},"links":{"citing_paper":"/paper/2608.03092"},"observation_digest":"sha256:43a78b452a020c1440802b5313dce87a03f0b772eccdcb8314c4149e9a5f736c","observation_id":"d606a231-f2ae-4509-8597-e32f247ea1ee","resolution":{"observed_at":"2026-08-15T14:57:53.885627Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:57:53.889122Z","title":"Machine Learning , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03092","last_updated":"2026-08-04T04:08:08Z","snapshot_observed_at":"2026-08-18T00:47:09.893632Z","submitted_at":"2026-08-04T04:08:08Z","title":"SMOPD: Multi-Reward Reinforcement Learning via Specialize-and-Merge Online Policy Distillation","version":1},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-15T14:57:53.889122Z"},"links":{"citing_paper":"/paper/2608.03092"},"observation_digest":"sha256:ce150462b92b7e180bf13620bcc94ea9ce6ad9b4b59dba3e2610e0236d6f3c87","observation_id":"2370deaa-773b-479e-b087-935cb248bd00","resolution":{"observed_at":"2026-08-15T14:57:53.889122Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:57:53.892306Z","title":"2024 , eprint=","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.03092","last_updated":"2026-08-04T04:08:08Z","snapshot_observed_at":"2026-08-18T00:47:09.893632Z","submitted_at":"2026-08-04T04:08:08Z","title":"SMOPD: Multi-Reward Reinforcement Learning via Specialize-and-Merge Online Policy Distillation","version":1},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-15T14:57:53.892306Z"},"links":{"citing_paper":"/paper/2608.03092"},"observation_digest":"sha256:89355b3512f4ea2f43470abb07f250d0a498591f9d3fd395109c1625b16659bb","observation_id":"4003c66c-0810-457c-b427-a3be5aa1dc7d","resolution":{"observed_at":"2026-08-15T14:57:53.892306Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:57:53.895395Z","title":"Findings of the association for computational linguistics: EMNLP 2024 , pages=","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.03092","last_updated":"2026-08-04T04:08:08Z","snapshot_observed_at":"2026-08-18T00:47:09.893632Z","submitted_at":"2026-08-04T04:08:08Z","title":"SMOPD: Multi-Reward Reinforcement Learning via Specialize-and-Merge Online Policy Distillation","version":1},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-08-15T14:57:53.895395Z"},"links":{"citing_paper":"/paper/2608.03092"},"observation_digest":"sha256:500abf9a9e03bd51fcd4ea4fae25d37408c76509c1075c203ddc4f18e9590ae3","observation_id":"96673f63-9191-467a-80d1-a86c82d45f75","resolution":{"observed_at":"2026-08-15T14:57:53.895395Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.03126","last_updated":"2023-09-15T09:24:30Z","snapshot_observed_at":"2026-08-16T15:02:46.914767Z","submitted_at":"2023-09-06T16:03:59Z","title":"Everyone Deserves A Reward: Learning Customized Human Preferences","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.03126","snapshot_observed_at":"2026-08-15T14:57:53.898499Z","title":"arXiv preprint arXiv:2309.03126 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03092","last_updated":"2026-08-04T04:08:08Z","snapshot_observed_at":"2026-08-18T00:47:09.893632Z","submitted_at":"2026-08-04T04:08:08Z","title":"SMOPD: Multi-Reward Reinforcement Learning via Specialize-and-Merge Online Policy Distillation","version":1},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-08-15T14:57:53.898499Z"},"links":{"cited_paper":"/paper/2309.03126","citing_paper":"/paper/2608.03092"},"observation_digest":"sha256:53a663677f923a6fc15aac0f7a65ecb0400c929525b68dbacd089e46ac262d78","observation_id":"fb436b5f-bffc-44f3-8219-b28e115e373f","resolution":{"observed_at":"2026-08-15T14:57:53.898499Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.07491","last_updated":"2025-06-23T13:45:50Z","snapshot_observed_at":"2026-08-17T03:46:28.942551Z","submitted_at":"2025-04-10T06:48:26Z","title":"Kimi-VL Technical Report","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.07491","snapshot_observed_at":"2026-08-15T14:57:53.902060Z","title":"arXiv preprint arXiv:2504.07491 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03092","last_updated":"2026-08-04T04:08:08Z","snapshot_observed_at":"2026-08-18T00:47:09.893632Z","submitted_at":"2026-08-04T04:08:08Z","title":"SMOPD: Multi-Reward Reinforcement Learning via Specialize-and-Merge Online Policy Distillation","version":1},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-08-15T14:57:53.902060Z"},"links":{"cited_paper":"/paper/2504.07491","citing_paper":"/paper/2608.03092"},"observation_digest":"sha256:8f270d44d002903804d0cdbfcdf76ec80c6d4cad27e01e33aead729ba8b2d722","observation_id":"17f84292-f9a6-42c0-938a-43315dd4d88a","resolution":{"observed_at":"2026-08-15T14:57:53.902060Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:57:53.905649Z","title":"Advances in neural information processing systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03092","last_updated":"2026-08-04T04:08:08Z","snapshot_observed_at":"2026-08-18T00:47:09.893632Z","submitted_at":"2026-08-04T04:08:08Z","title":"SMOPD: Multi-Reward Reinforcement Learning via Specialize-and-Merge Online Policy Distillation","version":1},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-08-15T14:57:53.905649Z"},"links":{"citing_paper":"/paper/2608.03092"},"observation_digest":"sha256:a530ce6291450ff1cf51f34590906082b520208a2e698f98fe8e51d37f918a72","observation_id":"5c547009-05c7-4ae9-8842-3864d34f42c6","resolution":{"observed_at":"2026-08-15T14:57:53.905649Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:57:53.909368Z","title":"2024 , eprint=","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.03092","last_updated":"2026-08-04T04:08:08Z","snapshot_observed_at":"2026-08-18T00:47:09.893632Z","submitted_at":"2026-08-04T04:08:08Z","title":"SMOPD: Multi-Reward Reinforcement Learning via Specialize-and-Merge Online Policy Distillation","version":1},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-08-15T14:57:53.909368Z"},"links":{"citing_paper":"/paper/2608.03092"},"observation_digest":"sha256:e35456274cd8fb9d4add4f00a11dd8941156a77bb343be97174d9df2225622aa","observation_id":"e7d3048e-1d8c-4e85-be5b-7b2308f1e963","resolution":{"observed_at":"2026-08-15T14:57:53.909368Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:57:53.912159Z","title":"2000 , eprint=","venue":null,"work_id":null,"year":2000},"citing_paper":{"arxiv_id":"2608.03092","last_updated":"2026-08-04T04:08:08Z","snapshot_observed_at":"2026-08-18T00:47:09.893632Z","submitted_at":"2026-08-04T04:08:08Z","title":"SMOPD: Multi-Reward Reinforcement Learning via Specialize-and-Merge Online Policy Distillation","version":1},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-08-15T14:57:53.912159Z"},"links":{"citing_paper":"/paper/2608.03092"},"observation_digest":"sha256:547994563e8fc0502605a4052827c54954419559af6c54b231c8226841af945d","observation_id":"37c9e7be-5e37-4de4-a6ae-018e2e77da91","resolution":{"observed_at":"2026-08-15T14:57:53.912159Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:57:53.916002Z","title":"1997 , publisher=","venue":null,"work_id":null,"year":1997},"citing_paper":{"arxiv_id":"2608.03092","last_updated":"2026-08-04T04:08:08Z","snapshot_observed_at":"2026-08-18T00:47:09.893632Z","submitted_at":"2026-08-04T04:08:08Z","title":"SMOPD: Multi-Reward Reinforcement Learning via Specialize-and-Merge Online Policy Distillation","version":1},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-08-15T14:57:53.916002Z"},"links":{"citing_paper":"/paper/2608.03092"},"observation_digest":"sha256:fad65f51b3ff391028a5ff7eb1202dc2244a4500e91648624c6c07c070583fb8","observation_id":"ed62110f-f4e8-4f0a-8f43-9a5398d88936","resolution":{"observed_at":"2026-08-15T14:57:53.916002Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:57:53.919633Z","title":"International conference on machine learning , pages=","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2608.03092","last_updated":"2026-08-04T04:08:08Z","snapshot_observed_at":"2026-08-18T00:47:09.893632Z","submitted_at":"2026-08-04T04:08:08Z","title":"SMOPD: Multi-Reward Reinforcement Learning via Specialize-and-Merge Online Policy Distillation","version":1},"reference_index":67,"source":"arxiv_source","source_observed_at":"2026-08-15T14:57:53.919633Z"},"links":{"citing_paper":"/paper/2608.03092"},"observation_digest":"sha256:3a7946456ad6e43714e3cc50326ca2635ddec2d03c0990c6e8b6484e498d3a7d","observation_id":"0a830bc8-5b09-4916-afbd-fc7199199291","resolution":{"observed_at":"2026-08-15T14:57:53.919633Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:57:53.922992Z","title":"International conference on machine learning , pages=","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.03092","last_updated":"2026-08-04T04:08:08Z","snapshot_observed_at":"2026-08-18T00:47:09.893632Z","submitted_at":"2026-08-04T04:08:08Z","title":"SMOPD: Multi-Reward Reinforcement Learning via Specialize-and-Merge Online Policy Distillation","version":1},"reference_index":68,"source":"arxiv_source","source_observed_at":"2026-08-15T14:57:53.922992Z"},"links":{"citing_paper":"/paper/2608.03092"},"observation_digest":"sha256:b0a76622318a4e7ace8978f301353167e883728cb4f43d42d73aca868a48a7c1","observation_id":"74fe22e8-2260-483f-be44-6ee4dc7feb15","resolution":{"observed_at":"2026-08-15T14:57:53.922992Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1807.03748","last_updated":"2019-01-22T18:47:12Z","snapshot_observed_at":"2026-08-14T18:53:38.574749Z","submitted_at":"2018-07-10T16:52:11Z","title":"Representation Learning with Contrastive Predictive Coding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1807.03748","snapshot_observed_at":"2026-08-15T14:57:53.926780Z","title":"arXiv preprint arXiv:1807.03748 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03092","last_updated":"2026-08-04T04:08:08Z","snapshot_observed_at":"2026-08-18T00:47:09.893632Z","submitted_at":"2026-08-04T04:08:08Z","title":"SMOPD: Multi-Reward Reinforcement Learning via Specialize-and-Merge Online Policy Distillation","version":1},"reference_index":69,"source":"arxiv_source","source_observed_at":"2026-08-15T14:57:53.926780Z"},"links":{"cited_paper":"/paper/1807.03748","citing_paper":"/paper/2608.03092"},"observation_digest":"sha256:cd8972d8db34827019baf6497dace4db2c991f8cde6b477906afb291b52a2cf2","observation_id":"ff4ac2d3-d624-4216-bc39-52052533cbe1","resolution":{"observed_at":"2026-08-15T14:57:53.926780Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:57:53.930464Z","title":"2019 , eprint=","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2608.03092","last_updated":"2026-08-04T04:08:08Z","snapshot_observed_at":"2026-08-18T00:47:09.893632Z","submitted_at":"2026-08-04T04:08:08Z","title":"SMOPD: Multi-Reward Reinforcement Learning via Specialize-and-Merge Online Policy Distillation","version":1},"reference_index":70,"source":"arxiv_source","source_observed_at":"2026-08-15T14:57:53.930464Z"},"links":{"citing_paper":"/paper/2608.03092"},"observation_digest":"sha256:908eb29a1875a3ccb0cede2972af3c243cdf88d5206ba9ca2325aff631b4517a","observation_id":"e8595768-a948-4f78-a4aa-69e7e79a006a","resolution":{"observed_at":"2026-08-15T14:57:53.930464Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:57:53.933734Z","title":"International conference on machine learning , pages=","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2608.03092","last_updated":"2026-08-04T04:08:08Z","snapshot_observed_at":"2026-08-18T00:47:09.893632Z","submitted_at":"2026-08-04T04:08:08Z","title":"SMOPD: Multi-Reward Reinforcement Learning via Specialize-and-Merge Online Policy Distillation","version":1},"reference_index":71,"source":"arxiv_source","source_observed_at":"2026-08-15T14:57:53.933734Z"},"links":{"citing_paper":"/paper/2608.03092"},"observation_digest":"sha256:2d2c74279015a715ca562cf6705c094fc7c98e22ae78eeac75068e2692b166ca","observation_id":"3b0a12de-5c06-49c9-b42c-d1066999ad54","resolution":{"observed_at":"2026-08-15T14:57:53.933734Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:57:53.937179Z","title":"Advances in neural information processing systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03092","last_updated":"2026-08-04T04:08:08Z","snapshot_observed_at":"2026-08-18T00:47:09.893632Z","submitted_at":"2026-08-04T04:08:08Z","title":"SMOPD: Multi-Reward Reinforcement Learning via Specialize-and-Merge Online Policy Distillation","version":1},"reference_index":72,"source":"arxiv_source","source_observed_at":"2026-08-15T14:57:53.937179Z"},"links":{"citing_paper":"/paper/2608.03092"},"observation_digest":"sha256:9fe3f29a0bc2bd468bde11e4ca779ff6565ecc7703f67452635c20cbe5e14279","observation_id":"efceb99c-e966-482d-88be-1bee64ba9100","resolution":{"observed_at":"2026-08-15T14:57:53.937179Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.03716","last_updated":"2024-07-10T23:15:49Z","snapshot_observed_at":"2026-08-16T14:54:43.078629Z","submitted_at":"2023-10-05T17:38:28Z","title":"A Long Way to Go: Investigating Length Correlations in RLHF","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.03716","snapshot_observed_at":"2026-08-15T14:57:53.940237Z","title":"arXiv preprint arXiv:2310.03716 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03092","last_updated":"2026-08-04T04:08:08Z","snapshot_observed_at":"2026-08-18T00:47:09.893632Z","submitted_at":"2026-08-04T04:08:08Z","title":"SMOPD: Multi-Reward Reinforcement Learning via Specialize-and-Merge Online Policy Distillation","version":1},"reference_index":73,"source":"arxiv_source","source_observed_at":"2026-08-15T14:57:53.940237Z"},"links":{"cited_paper":"/paper/2310.03716","citing_paper":"/paper/2608.03092"},"observation_digest":"sha256:fbbc1457260c9acf2a26352bd456f7bd8950b52929c266e22181c2ac25b50694","observation_id":"e1911532-51fd-466a-9c76-2074d31e8c6b","resolution":{"observed_at":"2026-08-15T14:57:53.940237Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.13548","last_updated":"2025-05-10T07:10:46Z","snapshot_observed_at":"2026-08-14T16:46:25.561386Z","submitted_at":"2023-10-20T14:46:48Z","title":"Towards Understanding Sycophancy in Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.13548","snapshot_observed_at":"2026-08-15T14:57:53.943369Z","title":"arXiv preprint arXiv:2310.13548 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03092","last_updated":"2026-08-04T04:08:08Z","snapshot_observed_at":"2026-08-18T00:47:09.893632Z","submitted_at":"2026-08-04T04:08:08Z","title":"SMOPD: Multi-Reward Reinforcement Learning via Specialize-and-Merge Online Policy Distillation","version":1},"reference_index":74,"source":"arxiv_source","source_observed_at":"2026-08-15T14:57:53.943369Z"},"links":{"cited_paper":"/paper/2310.13548","citing_paper":"/paper/2608.03092"},"observation_digest":"sha256:e53b06efb34e5a5f2bb97b044ecb1ac168b179648205ee4d2fb92b2dac3a5eb1","observation_id":"09f95b76-65fa-442f-af2a-decc09c41a21","resolution":{"observed_at":"2026-08-15T14:57:53.943369Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.09620","last_updated":"2025-05-29T02:21:03Z","snapshot_observed_at":"2026-08-13T04:40:45.853560Z","submitted_at":"2025-01-16T16:00:37Z","title":"Beyond Reward Hacking: Causal Rewards for Large Language Model Alignment","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.09620","snapshot_observed_at":"2026-08-15T14:57:53.946749Z","title":"arXiv preprint arXiv:2501.09620 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03092","last_updated":"2026-08-04T04:08:08Z","snapshot_observed_at":"2026-08-18T00:47:09.893632Z","submitted_at":"2026-08-04T04:08:08Z","title":"SMOPD: Multi-Reward Reinforcement Learning via Specialize-and-Merge Online Policy Distillation","version":1},"reference_index":75,"source":"arxiv_source","source_observed_at":"2026-08-15T14:57:53.946749Z"},"links":{"cited_paper":"/paper/2501.09620","citing_paper":"/paper/2608.03092"},"observation_digest":"sha256:753e719806cb614b65816a3dcb47b0874bf3777550fe5629121ef4613bb976b4","observation_id":"f904c68f-6879-4859-8ce7-4640b3670e3c","resolution":{"observed_at":"2026-08-15T14:57:53.946749Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.05199","last_updated":"2023-11-29T14:45:53Z","snapshot_observed_at":"2026-08-16T14:54:04.149872Z","submitted_at":"2023-10-08T15:14:39Z","title":"Loose lips sink ships: Mitigating Length Bias in Reinforcement Learning from Human Feedback","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.05199","snapshot_observed_at":"2026-08-15T14:57:53.950455Z","title":"arXiv preprint arXiv:2310.05199 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03092","last_updated":"2026-08-04T04:08:08Z","snapshot_observed_at":"2026-08-18T00:47:09.893632Z","submitted_at":"2026-08-04T04:08:08Z","title":"SMOPD: Multi-Reward Reinforcement Learning via Specialize-and-Merge Online Policy Distillation","version":1},"reference_index":76,"source":"arxiv_source","source_observed_at":"2026-08-15T14:57:53.950455Z"},"links":{"cited_paper":"/paper/2310.05199","citing_paper":"/paper/2608.03092"},"observation_digest":"sha256:9f84635094453adc20e2439f8b7fb614f17a9ac71ef4fad2810639363104f689","observation_id":"5ef0411b-074d-420d-b9bb-4b3e3314c8c2","resolution":{"observed_at":"2026-08-15T14:57:53.950455Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:57:53.953858Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03092","last_updated":"2026-08-04T04:08:08Z","snapshot_observed_at":"2026-08-18T00:47:09.893632Z","submitted_at":"2026-08-04T04:08:08Z","title":"SMOPD: Multi-Reward Reinforcement Learning via Specialize-and-Merge Online Policy Distillation","version":1},"reference_index":77,"source":"arxiv_source","source_observed_at":"2026-08-15T14:57:53.953858Z"},"links":{"citing_paper":"/paper/2608.03092"},"observation_digest":"sha256:2dc88a83316183d18b40b8e2f94a5ab001032741352a65799244df54e1ac62f4","observation_id":"90036455-6a28-4aa9-8e78-d0208b1910d2","resolution":{"observed_at":"2026-08-15T14:57:53.953858Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:57:53.957789Z","title":"2025 , eprint=","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.03092","last_updated":"2026-08-04T04:08:08Z","snapshot_observed_at":"2026-08-18T00:47:09.893632Z","submitted_at":"2026-08-04T04:08:08Z","title":"SMOPD: Multi-Reward Reinforcement Learning via Specialize-and-Merge Online Policy Distillation","version":1},"reference_index":78,"source":"arxiv_source","source_observed_at":"2026-08-15T14:57:53.957789Z"},"links":{"citing_paper":"/paper/2608.03092"},"observation_digest":"sha256:e0a70985a9f78a8b1e75cfc5273c49cb762c40311da5974d0df9f9d04fd245cf","observation_id":"dcdda4da-491a-432d-a3a1-4b8f546c4c3d","resolution":{"observed_at":"2026-08-15T14:57:53.957789Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:57:53.961334Z","title":"Findings of the Association for Computational Linguistics: NAACL 2025 , pages=","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.03092","last_updated":"2026-08-04T04:08:08Z","snapshot_observed_at":"2026-08-18T00:47:09.893632Z","submitted_at":"2026-08-04T04:08:08Z","title":"SMOPD: Multi-Reward Reinforcement Learning via Specialize-and-Merge Online Policy Distillation","version":1},"reference_index":79,"source":"arxiv_source","source_observed_at":"2026-08-15T14:57:53.961334Z"},"links":{"citing_paper":"/paper/2608.03092"},"observation_digest":"sha256:aeeecd21249f2e811a9721b66e1f14fd54eaaa90ddaee174c2e28d87863d3ea3","observation_id":"d8724f47-7509-4199-9099-2e2d18c147e5","resolution":{"observed_at":"2026-08-15T14:57:53.961334Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:57:53.964603Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03092","last_updated":"2026-08-04T04:08:08Z","snapshot_observed_at":"2026-08-18T00:47:09.893632Z","submitted_at":"2026-08-04T04:08:08Z","title":"SMOPD: Multi-Reward Reinforcement Learning via Specialize-and-Merge Online Policy Distillation","version":1},"reference_index":80,"source":"arxiv_source","source_observed_at":"2026-08-15T14:57:53.964603Z"},"links":{"citing_paper":"/paper/2608.03092"},"observation_digest":"sha256:66e8708d53bd5037f123e98fb29bccce790b4a143aba6e67eeab1e7ebec56de5","observation_id":"783e67f2-7ba2-4956-96bd-cd9d5f43d6f6","resolution":{"observed_at":"2026-08-15T14:57:53.964603Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21276","last_updated":"2024-10-25T17:43:01Z","snapshot_observed_at":"2026-08-15T14:02:47.366139Z","submitted_at":"2024-10-25T17:43:01Z","title":"GPT-4o System Card","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.21276","snapshot_observed_at":"2026-08-15T14:57:53.967415Z","title":"arXiv preprint arXiv:2410.21276 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03092","last_updated":"2026-08-04T04:08:08Z","snapshot_observed_at":"2026-08-18T00:47:09.893632Z","submitted_at":"2026-08-04T04:08:08Z","title":"SMOPD: Multi-Reward Reinforcement Learning via Specialize-and-Merge Online Policy Distillation","version":1},"reference_index":81,"source":"arxiv_source","source_observed_at":"2026-08-15T14:57:53.967415Z"},"links":{"cited_paper":"/paper/2410.21276","citing_paper":"/paper/2608.03092"},"observation_digest":"sha256:f65acb280fe504162cba4d89296f7f75edf47e4bbc93c465acd63b3b5c2dbb0d","observation_id":"283518ca-0f74-43ac-9f73-68e4f8110187","resolution":{"observed_at":"2026-08-15T14:57:53.967415Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:57:53.970403Z","title":"2022 , eprint=","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.03092","last_updated":"2026-08-04T04:08:08Z","snapshot_observed_at":"2026-08-18T00:47:09.893632Z","submitted_at":"2026-08-04T04:08:08Z","title":"SMOPD: Multi-Reward Reinforcement Learning via Specialize-and-Merge Online Policy Distillation","version":1},"reference_index":82,"source":"arxiv_source","source_observed_at":"2026-08-15T14:57:53.970403Z"},"links":{"citing_paper":"/paper/2608.03092"},"observation_digest":"sha256:7bf629827f7132dc24e80ed7e1c436cddd564735474f940a88e8c63ea52a4711","observation_id":"c6c8126d-f837-483d-947e-fbd78482a8dd","resolution":{"observed_at":"2026-08-15T14:57:53.970403Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:57:53.973324Z","title":"2023 , eprint=","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.03092","last_updated":"2026-08-04T04:08:08Z","snapshot_observed_at":"2026-08-18T00:47:09.893632Z","submitted_at":"2026-08-04T04:08:08Z","title":"SMOPD: Multi-Reward Reinforcement Learning via Specialize-and-Merge Online Policy Distillation","version":1},"reference_index":83,"source":"arxiv_source","source_observed_at":"2026-08-15T14:57:53.973324Z"},"links":{"citing_paper":"/paper/2608.03092"},"observation_digest":"sha256:7908b41cf35327a43d154531d33e9e3b97debfaffcdaffe7979bf9e796387d87","observation_id":"81a4ea9b-7e5b-4972-8c5a-333a96a32c0f","resolution":{"observed_at":"2026-08-15T14:57:53.973324Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:57:53.976058Z","title":"2024 , eprint=","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.03092","last_updated":"2026-08-04T04:08:08Z","snapshot_observed_at":"2026-08-18T00:47:09.893632Z","submitted_at":"2026-08-04T04:08:08Z","title":"SMOPD: Multi-Reward Reinforcement Learning via Specialize-and-Merge Online Policy Distillation","version":1},"reference_index":84,"source":"arxiv_source","source_observed_at":"2026-08-15T14:57:53.976058Z"},"links":{"citing_paper":"/paper/2608.03092"},"observation_digest":"sha256:f8c15f246988063d0f24a9793b735f5447e097989c0a1d61439d8f146282f790","observation_id":"8f68f78d-087d-498d-8e1d-b1b9609f78ce","resolution":{"observed_at":"2026-08-15T14:57:53.976058Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:57:53.979341Z","title":"2025 , eprint=","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.03092","last_updated":"2026-08-04T04:08:08Z","snapshot_observed_at":"2026-08-18T00:47:09.893632Z","submitted_at":"2026-08-04T04:08:08Z","title":"SMOPD: Multi-Reward Reinforcement Learning via Specialize-and-Merge Online Policy Distillation","version":1},"reference_index":85,"source":"arxiv_source","source_observed_at":"2026-08-15T14:57:53.979341Z"},"links":{"citing_paper":"/paper/2608.03092"},"observation_digest":"sha256:89459321770bef153bb04afd5a652482338ad78f1e964f5494e567c980367a6d","observation_id":"cd26a059-5d3c-4d27-828a-4c16ff5ba1a5","resolution":{"observed_at":"2026-08-15T14:57:53.979341Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:57:53.982198Z","title":"Interpretable Preferences via Multi-Objective Reward Modeling and Mixture-of-Experts","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.03092","last_updated":"2026-08-04T04:08:08Z","snapshot_observed_at":"2026-08-18T00:47:09.893632Z","submitted_at":"2026-08-04T04:08:08Z","title":"SMOPD: Multi-Reward Reinforcement Learning via Specialize-and-Merge Online Policy Distillation","version":1},"reference_index":86,"source":"arxiv_source","source_observed_at":"2026-08-15T14:57:53.982198Z"},"links":{"citing_paper":"/paper/2608.03092"},"observation_digest":"sha256:4e084ca4876207cb504ab21248c758e4c11d75193a217f6624a3d37578ab734e","observation_id":"2c52bc28-2c74-4fa0-9f45-d1f6cf46fb42","resolution":{"observed_at":"2026-08-15T14:57:53.982198Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:57:53.985088Z","title":"2024 , eprint=","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.03092","last_updated":"2026-08-04T04:08:08Z","snapshot_observed_at":"2026-08-18T00:47:09.893632Z","submitted_at":"2026-08-04T04:08:08Z","title":"SMOPD: Multi-Reward Reinforcement Learning via Specialize-and-Merge Online Policy Distillation","version":1},"reference_index":87,"source":"arxiv_source","source_observed_at":"2026-08-15T14:57:53.985088Z"},"links":{"citing_paper":"/paper/2608.03092"},"observation_digest":"sha256:6aa1422cc802de3abe99ece988ea4acfa16b118898cdb36f030c7eb1a4826d4e","observation_id":"8d7d7669-d088-4acb-b031-e45a426084a8","resolution":{"observed_at":"2026-08-15T14:57:53.985088Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:57:53.988450Z","title":"2021 , booktitle=","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.03092","last_updated":"2026-08-04T04:08:08Z","snapshot_observed_at":"2026-08-18T00:47:09.893632Z","submitted_at":"2026-08-04T04:08:08Z","title":"SMOPD: Multi-Reward Reinforcement Learning via Specialize-and-Merge Online Policy Distillation","version":1},"reference_index":88,"source":"arxiv_source","source_observed_at":"2026-08-15T14:57:53.988450Z"},"links":{"citing_paper":"/paper/2608.03092"},"observation_digest":"sha256:cf185f9a88769499bc00e3497292614ce7ff089051a1d3ba7ff708dde93dd266","observation_id":"6d1257dc-eee2-430c-9915-3f920322fb5b","resolution":{"observed_at":"2026-08-15T14:57:53.988450Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:57:53.991165Z","title":"2019 , booktitle=","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2608.03092","last_updated":"2026-08-04T04:08:08Z","snapshot_observed_at":"2026-08-18T00:47:09.893632Z","submitted_at":"2026-08-04T04:08:08Z","title":"SMOPD: Multi-Reward Reinforcement Learning via Specialize-and-Merge Online Policy Distillation","version":1},"reference_index":89,"source":"arxiv_source","source_observed_at":"2026-08-15T14:57:53.991165Z"},"links":{"citing_paper":"/paper/2608.03092"},"observation_digest":"sha256:325925dd24d8aa10d08c5e5b72be8bce6b43e94671f027f0b84c52e70505123c","observation_id":"98600c1f-5a41-4af8-ae8b-0c0c8d4267af","resolution":{"observed_at":"2026-08-15T14:57:53.991165Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:57:53.994950Z","title":"2025 , eprint=","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.03092","last_updated":"2026-08-04T04:08:08Z","snapshot_observed_at":"2026-08-18T00:47:09.893632Z","submitted_at":"2026-08-04T04:08:08Z","title":"SMOPD: Multi-Reward Reinforcement Learning via Specialize-and-Merge Online Policy Distillation","version":1},"reference_index":90,"source":"arxiv_source","source_observed_at":"2026-08-15T14:57:53.994950Z"},"links":{"citing_paper":"/paper/2608.03092"},"observation_digest":"sha256:a9ceaa9388d65bd7abc9c23239a01dabdd8d4c32adab7447bc30c254e2d04830","observation_id":"eaeff446-e299-471c-bef7-f32774ea6311","resolution":{"observed_at":"2026-08-15T14:57:53.994950Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:57:53.998943Z","title":"The method of paired comparisons , author=","venue":null,"work_id":null,"year":1952},"citing_paper":{"arxiv_id":"2608.03092","last_updated":"2026-08-04T04:08:08Z","snapshot_observed_at":"2026-08-18T00:47:09.893632Z","submitted_at":"2026-08-04T04:08:08Z","title":"SMOPD: Multi-Reward Reinforcement Learning via Specialize-and-Merge Online Policy Distillation","version":1},"reference_index":91,"source":"arxiv_source","source_observed_at":"2026-08-15T14:57:53.998943Z"},"links":{"citing_paper":"/paper/2608.03092"},"observation_digest":"sha256:032468c793a47e8a8efd29debc0724fdb3fc779bcd79bf7bfec61aef6349ae49","observation_id":"c9157bab-d55e-46d8-972f-18644528a140","resolution":{"observed_at":"2026-08-15T14:57:53.998943Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:57:54.001963Z","title":"2022 , eprint=","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.03092","last_updated":"2026-08-04T04:08:08Z","snapshot_observed_at":"2026-08-18T00:47:09.893632Z","submitted_at":"2026-08-04T04:08:08Z","title":"SMOPD: Multi-Reward Reinforcement Learning via Specialize-and-Merge Online Policy Distillation","version":1},"reference_index":92,"source":"arxiv_source","source_observed_at":"2026-08-15T14:57:54.001963Z"},"links":{"citing_paper":"/paper/2608.03092"},"observation_digest":"sha256:b95e49b08aae5a4b83c47a638fd91c544c771a64d4b15a77d8ff3550135bc18f","observation_id":"3671c0d6-78d4-49cf-9a2f-e02ec65f551a","resolution":{"observed_at":"2026-08-15T14:57:54.001963Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:57:54.005398Z","title":"2024 , eprint=","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.03092","last_updated":"2026-08-04T04:08:08Z","snapshot_observed_at":"2026-08-18T00:47:09.893632Z","submitted_at":"2026-08-04T04:08:08Z","title":"SMOPD: Multi-Reward Reinforcement Learning via Specialize-and-Merge Online Policy Distillation","version":1},"reference_index":93,"source":"arxiv_source","source_observed_at":"2026-08-15T14:57:54.005398Z"},"links":{"citing_paper":"/paper/2608.03092"},"observation_digest":"sha256:8dff5dff7138998cfc83f03ae334e087bdb72d96439fbbd33be23ece32482b1e","observation_id":"6db5d0e8-e58a-437c-85d2-fc3a6e5e6409","resolution":{"observed_at":"2026-08-15T14:57:54.005398Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:57:54.008261Z","title":"2024 , eprint=","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.03092","last_updated":"2026-08-04T04:08:08Z","snapshot_observed_at":"2026-08-18T00:47:09.893632Z","submitted_at":"2026-08-04T04:08:08Z","title":"SMOPD: Multi-Reward Reinforcement Learning via Specialize-and-Merge Online Policy Distillation","version":1},"reference_index":94,"source":"arxiv_source","source_observed_at":"2026-08-15T14:57:54.008261Z"},"links":{"citing_paper":"/paper/2608.03092"},"observation_digest":"sha256:8ec81a269e5524a17684f59ca709597b3252e9bc0c6c8ae97c7563f7f43ef450","observation_id":"8a3c386e-3536-4b72-9788-809f86b0f89b","resolution":{"observed_at":"2026-08-15T14:57:54.008261Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:57:54.011160Z","title":"2024 , eprint=","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.03092","last_updated":"2026-08-04T04:08:08Z","snapshot_observed_at":"2026-08-18T00:47:09.893632Z","submitted_at":"2026-08-04T04:08:08Z","title":"SMOPD: Multi-Reward Reinforcement Learning via Specialize-and-Merge Online Policy Distillation","version":1},"reference_index":95,"source":"arxiv_source","source_observed_at":"2026-08-15T14:57:54.011160Z"},"links":{"citing_paper":"/paper/2608.03092"},"observation_digest":"sha256:605545e541b2d2b7bc7a54b98bda88eb562fd903abbdb04ea802d84104915242","observation_id":"6661f9bc-b9bc-4d85-a316-01b58d24a03f","resolution":{"observed_at":"2026-08-15T14:57:54.011160Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.03277","last_updated":"2023-04-06T17:58:09Z","snapshot_observed_at":"2026-08-16T13:26:40.822276Z","submitted_at":"2023-04-06T17:58:09Z","title":"Instruction Tuning with GPT-4","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.03277","snapshot_observed_at":"2026-08-15T14:57:54.014237Z","title":"arXiv preprint arXiv:2304.03277 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03092","last_updated":"2026-08-04T04:08:08Z","snapshot_observed_at":"2026-08-18T00:47:09.893632Z","submitted_at":"2026-08-04T04:08:08Z","title":"SMOPD: Multi-Reward Reinforcement Learning via Specialize-and-Merge Online Policy Distillation","version":1},"reference_index":96,"source":"arxiv_source","source_observed_at":"2026-08-15T14:57:54.014237Z"},"links":{"cited_paper":"/paper/2304.03277","citing_paper":"/paper/2608.03092"},"observation_digest":"sha256:0cf5a99f147a4be657aa78eb88f2b83f6e642e80759b1a8fa9c013679821eae0","observation_id":"f7c4114e-0800-4c37-9b5e-fc611cca1038","resolution":{"observed_at":"2026-08-15T14:57:54.014237Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:57:54.017797Z","title":"2021 , eprint=","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.03092","last_updated":"2026-08-04T04:08:08Z","snapshot_observed_at":"2026-08-18T00:47:09.893632Z","submitted_at":"2026-08-04T04:08:08Z","title":"SMOPD: Multi-Reward Reinforcement Learning via Specialize-and-Merge Online Policy Distillation","version":1},"reference_index":97,"source":"arxiv_source","source_observed_at":"2026-08-15T14:57:54.017797Z"},"links":{"citing_paper":"/paper/2608.03092"},"observation_digest":"sha256:f32e8c01c97dec8383b82ec48a844d8ae461bdab8f3dfc47031f892ecdb8bbee","observation_id":"be4702e3-bdb3-4135-b817-af21f4a2d47a","resolution":{"observed_at":"2026-08-15T14:57:54.017797Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:57:54.021547Z","title":"2017 , eprint=","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2608.03092","last_updated":"2026-08-04T04:08:08Z","snapshot_observed_at":"2026-08-18T00:47:09.893632Z","submitted_at":"2026-08-04T04:08:08Z","title":"SMOPD: Multi-Reward Reinforcement Learning via Specialize-and-Merge Online Policy Distillation","version":1},"reference_index":98,"source":"arxiv_source","source_observed_at":"2026-08-15T14:57:54.021547Z"},"links":{"citing_paper":"/paper/2608.03092"},"observation_digest":"sha256:386bb0a2b05381e74fec38ca7fd2c0f5f378cc702f2b9b6a7eb589182824f75e","observation_id":"1884369b-ba39-47b9-86d7-cc2fd09e02fb","resolution":{"observed_at":"2026-08-15T14:57:54.021547Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:57:54.024618Z","title":"2017 , eprint=","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2608.03092","last_updated":"2026-08-04T04:08:08Z","snapshot_observed_at":"2026-08-18T00:47:09.893632Z","submitted_at":"2026-08-04T04:08:08Z","title":"SMOPD: Multi-Reward Reinforcement Learning via Specialize-and-Merge Online Policy Distillation","version":1},"reference_index":99,"source":"arxiv_source","source_observed_at":"2026-08-15T14:57:54.024618Z"},"links":{"citing_paper":"/paper/2608.03092"},"observation_digest":"sha256:69ce1864c2be496cd4733a22e466d172ee98fe80de66e651aaad8e0a0dbad2e0","observation_id":"a58c936d-b789-4294-8d0b-8761a1b6fc64","resolution":{"observed_at":"2026-08-15T14:57:54.024618Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:57:54.027500Z","title":"2019 , eprint=","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2608.03092","last_updated":"2026-08-04T04:08:08Z","snapshot_observed_at":"2026-08-18T00:47:09.893632Z","submitted_at":"2026-08-04T04:08:08Z","title":"SMOPD: Multi-Reward Reinforcement Learning via Specialize-and-Merge Online Policy Distillation","version":1},"reference_index":100,"source":"arxiv_source","source_observed_at":"2026-08-15T14:57:54.027500Z"},"links":{"citing_paper":"/paper/2608.03092"},"observation_digest":"sha256:838ffc3737dae5cf0f166acc058ad273e1b1c945ff822b56992a01417eafb130","observation_id":"9d8a1c50-2af2-488e-b1cd-26f9a98fee5a","resolution":{"observed_at":"2026-08-15T14:57:54.027500Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2608.03092","last_updated":"2026-08-04T04:08:08Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-18T00:47:09.893632Z","submitted_at":"2026-08-04T04:08:08Z","title":"SMOPD: Multi-Reward Reinforcement Learning via Specialize-and-Merge Online Policy Distillation"},"reference_resolution":{"displayed":100,"state_counts":{"malformed_identifier":0,"metadata_mismatch":2,"parse_uncertain":0,"unresolved":97,"verified_exact":1,"verified_fuzzy":0},"total_outbound_references":167},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"thesis":"As of 19 August 2026, this Paper Citation Record lists 100 of 167 outbound references and 0 inbound Pith citation observations for arXiv:2608.03092."}