{"as_of":"2026-08-11T07:49:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:bf764cc7b8f8d7ecb043129a2ee93bdf626d053e26ed7704d5273db9d659ab0e","coverage":[{"denominator":15,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":15,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T14:31:05.857015Z","state":"measured"},{"denominator":16,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":16,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-11T06:34:44.6726+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-10T20:33:46.647842Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"arxiv_reference","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":0,"observed_at":"2026-08-05T02:28:24.338817Z","source":"arxiv_reference"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.20336","last_updated":"2025-05-24T12:22:21Z","snapshot_observed_at":"2026-08-10T08:56:04.941901Z","submitted_at":"2025-05-24T12:22:21Z","title":"MOSLIM:Align with diverse preferences in prompts through reward classification","version":1},"cited_work":{"arxiv_id":"2505.20336","doi":"10.48550/arxiv.2505.20336","metadata_source":"arxiv_reference","pith_arxiv_id":"2505.20336","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"URL https: //doi.org/10.48550/arXiv.2505.20336","venue":"ArXiv.org","work_id":"155bb4d3-1a15-4685-a3fd-c83edfacdd37","year":2024},"citing_paper":{"arxiv_id":"2604.04497","last_updated":"2026-04-06T07:48:32Z","snapshot_observed_at":"2026-08-02T22:16:22.336359Z","submitted_at":"2026-04-06T07:48:32Z","title":"One Model for All: Multi-Objective Controllable Language Models","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-10T20:33:46.647842Z"},"links":{"cited_paper":"/paper/2505.20336","citing_paper":"/paper/2604.04497"},"observation_digest":"sha256:db200f45bd7c88065d6c7884ce5e65cca532350c20105f6022b58e3e4d3e686c","observation_id":"2de5b500-11de-4a72-8e35-5b040521bc9c","resolution":{"observed_at":"2026-05-10T20:35:45.814908Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2505.20336/citation-record","integrity":"/paper/2505.20336/integrity","json":"/paper/2505.20336/citation-record.json","paper":"/paper/2505.20336"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2402.14740","last_updated":"2024-02-26T18:26:25Z","snapshot_observed_at":"2026-08-09T14:30:33.899591Z","submitted_at":"2024-02-22T17:52:34Z","title":"Back to Basics: Revisiting REINFORCE Style Optimization for Learning from Human Feedback in LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.14740","snapshot_observed_at":"2026-08-07T14:31:04.575775Z","title":"Back to basics: Revisiting reinforce style optimization for learning from human feedback in llms","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.20336","last_updated":"2025-05-24T12:22:21Z","snapshot_observed_at":"2026-08-10T08:56:04.941901Z","submitted_at":"2025-05-24T12:22:21Z","title":"MOSLIM:Align with diverse preferences in prompts through reward classification","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T14:31:04.575775Z"},"links":{"cited_paper":"/paper/2402.14740","citing_paper":"/paper/2505.20336"},"observation_digest":"sha256:1386fd1f2116bba366853656c567af0c6f91fbb9cad86e167c197d9b11e51be7","observation_id":"06d0a058-c3cb-4990-abfd-c649518d201e","resolution":{"observed_at":"2026-08-07T14:31:04.575775Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.01377","last_updated":"2024-07-16T03:24:39Z","snapshot_observed_at":"2026-08-02T07:46:40.319683Z","submitted_at":"2023-10-02T17:40:01Z","title":"UltraFeedback: Boosting Language Models with Scaled AI Feedback","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.01377","snapshot_observed_at":"2026-08-07T14:31:04.758999Z","title":"Abhimanyu Dubey et al","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.20336","last_updated":"2025-05-24T12:22:21Z","snapshot_observed_at":"2026-08-10T08:56:04.941901Z","submitted_at":"2025-05-24T12:22:21Z","title":"MOSLIM:Align with diverse preferences in prompts through reward classification","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T14:31:04.758999Z"},"links":{"cited_paper":"/paper/2310.01377","citing_paper":"/paper/2505.20336"},"observation_digest":"sha256:92ff520246ad458195ee7729be5b0f972ce9aae9b3a8fd749e2c3106d52c6d5a","observation_id":"82af8d40-cac6-48eb-9022-41cfdd1e25c5","resolution":{"observed_at":"2026-08-07T14:31:04.758999Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.04792","last_updated":"2024-02-29T20:59:17Z","snapshot_observed_at":"2026-08-10T08:55:18.452315Z","submitted_at":"2024-02-07T12:31:13Z","title":"Direct Language Model Alignment from Online AI Feedback","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.04792","snapshot_observed_at":"2026-08-07T14:31:04.853691Z","title":"Shangmin Guo, Biao Zhang, Tianlin Liu, Tianqi Liu, Misha Khalman, Felipe Llinares, Alexandre Rame, Thomas Mesnard, Yao Zhao, Bilal Piot, et al","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.20336","last_updated":"2025-05-24T12:22:21Z","snapshot_observed_at":"2026-08-10T08:56:04.941901Z","submitted_at":"2025-05-24T12:22:21Z","title":"MOSLIM:Align with diverse preferences in prompts through reward classification","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T14:31:04.853691Z"},"links":{"cited_paper":"/paper/2402.04792","citing_paper":"/paper/2505.20336"},"observation_digest":"sha256:0796c963a2a537c24deefa3e74895aa6c0e9c845d29c4545811929c67708a72c","observation_id":"70ae6733-b1b2-4dfb-88e2-ee7e74a226c5","resolution":{"observed_at":"2026-08-07T14:31:04.853691Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.17977","last_updated":"2024-11-05T04:37:22Z","snapshot_observed_at":"2026-08-06T18:17:00.261187Z","submitted_at":"2024-05-28T09:06:18Z","title":"Aligning to Thousands of Preferences via System Message Generalization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.17977","snapshot_observed_at":"2026-08-07T14:31:04.948809Z","title":"Aligning to thousands of preferences via system message generalization","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.20336","last_updated":"2025-05-24T12:22:21Z","snapshot_observed_at":"2026-08-10T08:56:04.941901Z","submitted_at":"2025-05-24T12:22:21Z","title":"MOSLIM:Align with diverse preferences in prompts through reward classification","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T14:31:04.948809Z"},"links":{"cited_paper":"/paper/2405.17977","citing_paper":"/paper/2505.20336"},"observation_digest":"sha256:991b38727fc6d0e1f658f1e5ee03fbb8f1c581bc62cf05ada467f34aa9b9ba50","observation_id":"10a44876-4afa-4080-af6c-b2b9eea30c26","resolution":{"observed_at":"2026-08-07T14:31:04.948809Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.09764","last_updated":"2024-05-30T15:39:17Z","snapshot_observed_at":"2026-08-10T14:45:03.598349Z","submitted_at":"2024-02-15T07:29:43Z","title":"Aligning Crowd Feedback via Distributional Preference Reward Modeling","version":3},"cited_work":{"arxiv_id":"2402.09764","doi":null,"metadata_source":"pith","pith_arxiv_id":"2402.09764","snapshot_observed_at":"2026-08-07T14:31:06.356128Z","title":"Aligning Crowd Feedback via Distributional Preference Reward Modeling","venue":"cs.AI","work_id":"b23c5482-387b-4ba6-b9b3-a2e7376c4335","year":2024},"citing_paper":{"arxiv_id":"2505.20336","last_updated":"2025-05-24T12:22:21Z","snapshot_observed_at":"2026-08-10T08:56:04.941901Z","submitted_at":"2025-05-24T12:22:21Z","title":"MOSLIM:Align with diverse preferences in prompts through reward classification","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T14:31:05.044777Z"},"links":{"cited_paper":"/paper/2402.09764","citing_paper":"/paper/2505.20336"},"observation_digest":"sha256:38ed68d0e498f8f9ad04539e2152c649799d47c3907446dd846cd9b3448d45e8","observation_id":"62f35081-5fa3-4a89-8e4b-d5af209df259","resolution":{"observed_at":"2026-08-07T14:31:06.429572Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.02155","last_updated":"2022-03-04T07:04:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-03-04T07:04:42Z","title":"Training language models to follow instructions with human feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.02155","snapshot_observed_at":"2026-08-07T14:31:05.137376Z","title":"Long Ouyang, Jeff Wu, Xu Jiang, Diogo Almeida, Carroll L","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.20336","last_updated":"2025-05-24T12:22:21Z","snapshot_observed_at":"2026-08-10T08:56:04.941901Z","submitted_at":"2025-05-24T12:22:21Z","title":"MOSLIM:Align with diverse preferences in prompts through reward classification","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T14:31:05.137376Z"},"links":{"cited_paper":"/paper/2203.02155","citing_paper":"/paper/2505.20336"},"observation_digest":"sha256:a1c3732762e7a4aaadc843aea5af8c99ea280f14fa78641898ea58dfde61f016","observation_id":"44297587-a9cb-4257-854d-c403c37fff08","resolution":{"observed_at":"2026-08-07T14:31:05.137376Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.18290","last_updated":"2024-07-29T22:26:36Z","snapshot_observed_at":"2026-08-01T16:34:38.795326Z","submitted_at":"2023-05-29T17:57:46Z","title":"Direct Preference Optimization: Your Language Model is Secretly a Reward Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.18290","snapshot_observed_at":"2026-08-07T14:31:05.324933Z","title":"Rafael Rafailov, Archit Sharma, Eric Mitchell, Stefano Ermon, Christopher D","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.20336","last_updated":"2025-05-24T12:22:21Z","snapshot_observed_at":"2026-08-10T08:56:04.941901Z","submitted_at":"2025-05-24T12:22:21Z","title":"MOSLIM:Align with diverse preferences in prompts through reward classification","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T14:31:05.324933Z"},"links":{"cited_paper":"/paper/2305.18290","citing_paper":"/paper/2505.20336"},"observation_digest":"sha256:cf112e874a3189cfbdb1adec0dc7b822833dbc8a36aae8710a2b2c8ce35d2bc9","observation_id":"bcc5c1fd-e4c7-47db-96c4-153fe6678fa9","resolution":{"observed_at":"2026-08-07T14:31:05.324933Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.16119","last_updated":"2024-03-03T00:12:16Z","snapshot_observed_at":"2026-07-06T16:53:18.275859Z","submitted_at":"2023-10-24T18:18:11Z","title":"Ignore This Title and HackAPrompt: Exposing Systemic Vulnerabilities of LLMs through a Global Scale Prompt Hacking Competition","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.16119","snapshot_observed_at":"2026-08-07T14:31:05.462525Z","title":"John Schulman, Filip Wolski, Prafulla Dhariwal, Alec Radford, and Oleg Klimov","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.20336","last_updated":"2025-05-24T12:22:21Z","snapshot_observed_at":"2026-08-10T08:56:04.941901Z","submitted_at":"2025-05-24T12:22:21Z","title":"MOSLIM:Align with diverse preferences in prompts through reward classification","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T14:31:05.462525Z"},"links":{"cited_paper":"/paper/2311.16119","citing_paper":"/paper/2505.20336"},"observation_digest":"sha256:d5456c0818c32240e78cba44be89ab55f115a174e44247b633577024e427d5cc","observation_id":"3f5dbaf0-6f40-460e-90b1-29500f891c01","resolution":{"observed_at":"2026-08-07T14:31:05.462525Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.05685","last_updated":"2023-12-24T02:01:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-09T05:55:52Z","title":"Judging LLM-as-a-Judge with MT-Bench and Chatbot Arena","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.05685","snapshot_observed_at":"2026-08-07T14:31:05.773320Z","title":"13 Zhanhui Zhou, Jie Liu, Jing Shao, Xiangyu Yue, Chao Yang, Wanli Ouyang, and Yu Qiao","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.20336","last_updated":"2025-05-24T12:22:21Z","snapshot_observed_at":"2026-08-10T08:56:04.941901Z","submitted_at":"2025-05-24T12:22:21Z","title":"MOSLIM:Align with diverse preferences in prompts through reward classification","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T14:31:05.773320Z"},"links":{"cited_paper":"/paper/2306.05685","citing_paper":"/paper/2505.20336"},"observation_digest":"sha256:fb7d14f58ae29914638ae00c1e0ed95dbf1872539f0542a2a83d01f68e9c12bb","observation_id":"6b969249-ef59-424f-acf7-a4c47ca8d4b7","resolution":{"observed_at":"2026-08-07T14:31:05.773320Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:31:06.573796Z","title":"In the Table 5 in Ap- pendix B, <preference n > represents a preference intensity of n (1 ≤ n < nmax), where a larger n indicates a higher intensity","venue":null,"work_id":"b51b311a-e682-472c-b415-b0f37380e251","year":2023},"citing_paper":{"arxiv_id":"2505.20336","last_updated":"2025-05-24T12:22:21Z","snapshot_observed_at":"2026-08-10T08:56:04.941901Z","submitted_at":"2025-05-24T12:22:21Z","title":"MOSLIM:Align with diverse preferences in prompts through reward classification","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T14:31:05.857015Z"},"links":{"citing_paper":"/paper/2505.20336"},"observation_digest":"sha256:fbe5f731ffc72dcaeb39493df1b8f5224056e6ac790900a79d2e14795d31cb54","observation_id":"b27f801b-3457-4fb5-8e2f-571b173eed9a","resolution":{"observed_at":"2026-08-07T14:31:06.696901Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2009.01325","last_updated":"2022-02-15T19:09:36Z","snapshot_observed_at":"2026-08-06T19:18:51.065158Z","submitted_at":"2020-09-02T19:54:41Z","title":"Learning to summarize from human feedback","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2009.01325","snapshot_observed_at":"2026-08-07T14:31:05.558867Z","title":"semanticscholar.org/CorpusID:28695052","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2505.20336","last_updated":"2025-05-24T12:22:21Z","snapshot_observed_at":"2026-08-10T08:56:04.941901Z","submitted_at":"2025-05-24T12:22:21Z","title":"MOSLIM:Align with diverse preferences in prompts through reward classification","version":1},"reference_index":2017,"source":"pdf_text","source_observed_at":"2026-08-07T14:31:05.558867Z"},"links":{"cited_paper":"/paper/2009.01325","citing_paper":"/paper/2505.20336"},"observation_digest":"sha256:f5ed9a961d672f43aa19fa956ddf3407e4b23f2df7c58a8601a9c2d097a128f5","observation_id":"6ce1a30f-7a2f-4ed8-8f29-b91fe03a5eff","resolution":{"observed_at":"2026-08-07T14:31:05.558867Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.12845","last_updated":"2024-06-18T17:58:28Z","snapshot_observed_at":"2026-08-06T09:12:58.062581Z","submitted_at":"2024-06-18T17:58:28Z","title":"Interpretable Preferences via Multi-Objective Reward Modeling and Mixture-of-Experts","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.12845","snapshot_observed_at":"2026-08-07T14:31:05.677821Z","title":"Haoxiang Wang, Wei Xiong, Tengyang Xie, Han Zhao, and Tong Zhang","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.20336","last_updated":"2025-05-24T12:22:21Z","snapshot_observed_at":"2026-08-10T08:56:04.941901Z","submitted_at":"2025-05-24T12:22:21Z","title":"MOSLIM:Align with diverse preferences in prompts through reward classification","version":1},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-07T14:31:05.677821Z"},"links":{"cited_paper":"/paper/2406.12845","citing_paper":"/paper/2505.20336"},"observation_digest":"sha256:8ea16d906026e148b13e64c169cd469c7e8d93a6e6b3328656a0364f9367a98d","observation_id":"7323d348-b0fc-4847-9203-2a850d839a04","resolution":{"observed_at":"2026-08-07T14:31:05.677821Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.00254","last_updated":"2024-05-27T14:08:40Z","snapshot_observed_at":"2026-08-11T00:27:59.463264Z","submitted_at":"2024-04-30T23:57:23Z","title":"RLHF from Heterogeneous Feedback via Personalization and Preference Aggregation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.00254","snapshot_observed_at":"2026-08-07T14:31:05.229990Z","title":"Chanwoo Park, Mingyang Liu, Dingwen Kong, Kaiqing Zhang, and Asuman E","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.20336","last_updated":"2025-05-24T12:22:21Z","snapshot_observed_at":"2026-08-10T08:56:04.941901Z","submitted_at":"2025-05-24T12:22:21Z","title":"MOSLIM:Align with diverse preferences in prompts through reward classification","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-07T14:31:05.229990Z"},"links":{"cited_paper":"/paper/2405.00254","citing_paper":"/paper/2505.20336"},"observation_digest":"sha256:80b87304f5565804a6ba205f4004cc4893e401cd3777e22cc94d59d105b21e3d","observation_id":"310957cd-3dfd-4981-9928-d4c190692c08","resolution":{"observed_at":"2026-08-07T14:31:05.229990Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.04488","last_updated":"2023-10-16T13:53:14Z","snapshot_observed_at":"2026-07-06T15:39:45.449997Z","submitted_at":"2023-06-07T14:58:15Z","title":"Rewarded soups: towards Pareto-optimal alignment by interpolating weights fine-tuned on diverse rewards","version":2},"cited_work":{"arxiv_id":"2306.04488","doi":null,"metadata_source":"pith","pith_arxiv_id":"2306.04488","snapshot_observed_at":"2026-08-07T14:31:06.071637Z","title":"Rewarded soups: towards Pareto-optimal alignment by interpolating weights fine-tuned on diverse rewards","venue":"cs.LG","work_id":"cb0e479e-5862-45b9-9834-b1c601a43f1e","year":2023},"citing_paper":{"arxiv_id":"2505.20336","last_updated":"2025-05-24T12:22:21Z","snapshot_observed_at":"2026-08-10T08:56:04.941901Z","submitted_at":"2025-05-24T12:22:21Z","title":"MOSLIM:Align with diverse preferences in prompts through reward classification","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-07T14:31:05.386852Z"},"links":{"cited_paper":"/paper/2306.04488","citing_paper":"/paper/2505.20336"},"observation_digest":"sha256:8ec40587d2eb0f061721e05025db4f71150c9578aad7adf72896c346a094a588","observation_id":"1ee2d541-a903-4e3b-a6b8-2481a81d7726","resolution":{"observed_at":"2026-08-07T14:31:06.167627Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2204.05862","last_updated":"2022-04-12T15:02:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-04-12T15:02:38Z","title":"Training a Helpful and Harmless Assistant with Reinforcement Learning from Human Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.05862","snapshot_observed_at":"2026-08-07T14:31:04.657355Z","title":"Brown, Jack Clark, Sam McCandlish, Christopher Olah, Benjamin Mann, and Jared Kaplan","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.20336","last_updated":"2025-05-24T12:22:21Z","snapshot_observed_at":"2026-08-10T08:56:04.941901Z","submitted_at":"2025-05-24T12:22:21Z","title":"MOSLIM:Align with diverse preferences in prompts through reward classification","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-07T14:31:04.657355Z"},"links":{"cited_paper":"/paper/2204.05862","citing_paper":"/paper/2505.20336"},"observation_digest":"sha256:4a715bb35f4acc23703718526fa5a2e66b8d3e08d221abcbb30e47280781ba6a","observation_id":"69706b5c-63c6-4108-9952-3e4aa2897442","resolution":{"observed_at":"2026-08-07T14:31:04.657355Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2505.20336","last_updated":"2025-05-24T12:22:21Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-10T08:56:04.941901Z","submitted_at":"2025-05-24T12:22:21Z","title":"MOSLIM:Align with diverse preferences in prompts through reward classification"},"reference_resolution":{"displayed":15,"state_counts":{"malformed_identifier":0,"metadata_mismatch":2,"parse_uncertain":0,"unresolved":12,"verified_exact":0,"verified_fuzzy":1},"total_outbound_references":15},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"thesis":"As of 11 August 2026, this Paper Citation Record lists 15 of 15 outbound references and 1 inbound Pith citation observation for arXiv:2505.20336."}