{"as_of":"2026-08-17T16:02:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:0204c55b99903bd5f4ae26eb66e204315e41b87a4416665a82b98efeed1e9864","coverage":[{"denominator":33,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":33,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-10T21:31:45.734231Z","state":"measured"},{"denominator":33,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":33,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-17T06:30:58.91139+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2501.06248/citation-record","integrity":"/paper/2501.06248/integrity","json":"/paper/2501.06248/citation-record.json","paper":"/paper/2501.06248"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2204.05862","last_updated":"2022-04-12T15:02:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-04-12T15:02:38Z","title":"Training a Helpful and Harmless Assistant with Reinforcement Learning from Human Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.05862","snapshot_observed_at":"2026-08-10T21:31:45.586146Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.06248","last_updated":"2025-02-25T18:04:50Z","snapshot_observed_at":"2026-08-15T07:22:16.346093Z","submitted_at":"2025-01-08T19:03:17Z","title":"Utility-inspired Reward Transformations Improve Reinforcement Learning Training of Language Models","version":2},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-10T21:31:45.586146Z"},"links":{"cited_paper":"/paper/2204.05862","citing_paper":"/paper/2501.06248"},"observation_digest":"sha256:da35cd14dc0d222a1f0905116cc1d1a18f49dc9756cc61c1dcf4596af2246050","observation_id":"63b0bb0d-2444-4081-ac61-41292b01466b","resolution":{"observed_at":"2026-08-10T21:31:45.586146Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2108.07258","last_updated":"2022-07-12T23:45:14Z","snapshot_observed_at":"2026-08-02T09:20:40.804790Z","submitted_at":"2021-08-16T17:50:08Z","title":"On the Opportunities and Risks of Foundation Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2108.07258","snapshot_observed_at":"2026-08-10T21:31:45.591475Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.06248","last_updated":"2025-02-25T18:04:50Z","snapshot_observed_at":"2026-08-15T07:22:16.346093Z","submitted_at":"2025-01-08T19:03:17Z","title":"Utility-inspired Reward Transformations Improve Reinforcement Learning Training of Language Models","version":2},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-10T21:31:45.591475Z"},"links":{"cited_paper":"/paper/2108.07258","citing_paper":"/paper/2501.06248"},"observation_digest":"sha256:69a6cf9612a9b5ec533a2761766d52f2e5e02e33c70f7aed735c4f24f33472d9","observation_id":"69553556-f3f6-4317-9aeb-0f9ea8d6161c","resolution":{"observed_at":"2026-08-10T21:31:45.591475Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.14165","last_updated":"2020-07-22T19:47:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-05-28T17:29:03Z","title":"Language Models are Few-Shot Learners","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.14165","snapshot_observed_at":"2026-08-10T21:31:45.596208Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2501.06248","last_updated":"2025-02-25T18:04:50Z","snapshot_observed_at":"2026-08-15T07:22:16.346093Z","submitted_at":"2025-01-08T19:03:17Z","title":"Utility-inspired Reward Transformations Improve Reinforcement Learning Training of Language Models","version":2},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-10T21:31:45.596208Z"},"links":{"cited_paper":"/paper/2005.14165","citing_paper":"/paper/2501.06248"},"observation_digest":"sha256:1554721bc490447d7ae960a9fc65236e180f4eafde5b78ed12d8834966a7f100","observation_id":"056526bc-d7af-4d73-a5af-30a5c2f08331","resolution":{"observed_at":"2026-08-10T21:31:45.596208Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:31:45.602059Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2501.06248","last_updated":"2025-02-25T18:04:50Z","snapshot_observed_at":"2026-08-15T07:22:16.346093Z","submitted_at":"2025-01-08T19:03:17Z","title":"Utility-inspired Reward Transformations Improve Reinforcement Learning Training of Language Models","version":2},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-10T21:31:45.602059Z"},"links":{"citing_paper":"/paper/2501.06248"},"observation_digest":"sha256:cb7e62ff08a4ea7693c65f1229880ef6d7b218b37343d54937442e7e6e1a7050","observation_id":"e3b3b00e-561a-4824-ad5b-31f4003490f7","resolution":{"observed_at":"2026-08-10T21:31:45.602059Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.10271","last_updated":"2024-06-04T14:34:38Z","snapshot_observed_at":"2026-08-16T14:00:38.756250Z","submitted_at":"2024-04-16T03:59:33Z","title":"Social Choice Should Guide AI Alignment in Dealing with Diverse Human Feedback","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.10271","snapshot_observed_at":"2026-08-10T21:31:45.607085Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.06248","last_updated":"2025-02-25T18:04:50Z","snapshot_observed_at":"2026-08-15T07:22:16.346093Z","submitted_at":"2025-01-08T19:03:17Z","title":"Utility-inspired Reward Transformations Improve Reinforcement Learning Training of Language Models","version":2},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-10T21:31:45.607085Z"},"links":{"cited_paper":"/paper/2404.10271","citing_paper":"/paper/2501.06248"},"observation_digest":"sha256:e3f74a4941e5bd0887d9712a718e7daf2784cf850ec2ed38318439f0f6bc09d6","observation_id":"817eda52-d0f5-431c-bd61-25f2726e6f93","resolution":{"observed_at":"2026-08-10T21:31:45.607085Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.09244","last_updated":"2024-08-16T23:59:29Z","snapshot_observed_at":"2026-08-16T14:34:38.657827Z","submitted_at":"2023-12-14T18:59:04Z","title":"Helping or Herding? Reward Model Ensembles Mitigate but do not Eliminate Reward Hacking","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.09244","snapshot_observed_at":"2026-08-10T21:31:45.612012Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.06248","last_updated":"2025-02-25T18:04:50Z","snapshot_observed_at":"2026-08-15T07:22:16.346093Z","submitted_at":"2025-01-08T19:03:17Z","title":"Utility-inspired Reward Transformations Improve Reinforcement Learning Training of Language Models","version":2},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-10T21:31:45.612012Z"},"links":{"cited_paper":"/paper/2312.09244","citing_paper":"/paper/2501.06248"},"observation_digest":"sha256:68e3595ad930f28762db591ff4530375e5899b990344e05cef1b8a89000ee5c4","observation_id":"3abef2ae-4105-4fe2-bd5a-372bbf6d1b1c","resolution":{"observed_at":"2026-08-10T21:31:45.612012Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2105.14652","last_updated":"2021-05-31T00:06:10Z","snapshot_observed_at":"2026-08-16T18:21:03.116993Z","submitted_at":"2021-05-31T00:06:10Z","title":"Attention Flows are Shapley Value Explanations","version":1},"cited_work":{"arxiv_id":"2105.14652","doi":null,"metadata_source":"pith","pith_arxiv_id":"2105.14652","snapshot_observed_at":"2026-08-10T21:31:46.031413Z","title":"Attention Flows are Shapley Value Explanations","venue":"cs.CL","work_id":"b82ded82-67c8-4b95-9303-00d73d90f1ad","year":2021},"citing_paper":{"arxiv_id":"2501.06248","last_updated":"2025-02-25T18:04:50Z","snapshot_observed_at":"2026-08-15T07:22:16.346093Z","submitted_at":"2025-01-08T19:03:17Z","title":"Utility-inspired Reward Transformations Improve Reinforcement Learning Training of Language Models","version":2},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-10T21:31:45.617402Z"},"links":{"cited_paper":"/paper/2105.14652","citing_paper":"/paper/2501.06248"},"observation_digest":"sha256:a59cd1ba7cf6cdd6bd15d222c00e09df8937efd319c4a33a677a9f6bc1f37a07","observation_id":"0ef1db20-cc05-4cec-9123-ba7a076ec3f8","resolution":{"observed_at":"2026-08-10T21:31:46.036410Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.14758","last_updated":"2024-11-07T15:40:25Z","snapshot_observed_at":"2026-08-16T18:26:32.680092Z","submitted_at":"2024-05-23T16:29:29Z","title":"Axioms for AI Alignment from Human Feedback","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.14758","snapshot_observed_at":"2026-08-10T21:31:45.621875Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.06248","last_updated":"2025-02-25T18:04:50Z","snapshot_observed_at":"2026-08-15T07:22:16.346093Z","submitted_at":"2025-01-08T19:03:17Z","title":"Utility-inspired Reward Transformations Improve Reinforcement Learning Training of Language Models","version":2},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-10T21:31:45.621875Z"},"links":{"cited_paper":"/paper/2405.14758","citing_paper":"/paper/2501.06248"},"observation_digest":"sha256:1aaed3e0bf8f0120c23bba95d18645c2bcfe6c5e845fa5419d68eaf046a93c1b","observation_id":"d43c383f-e8ab-48e3-9731-411802b1b3a6","resolution":{"observed_at":"2026-08-10T21:31:45.621875Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.08295","last_updated":"2024-04-16T12:52:47Z","snapshot_observed_at":"2026-08-03T03:29:01.959523Z","submitted_at":"2024-03-13T06:59:16Z","title":"Gemma: Open Models Based on Gemini Research and Technology","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.08295","snapshot_observed_at":"2026-08-10T21:31:45.626337Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.06248","last_updated":"2025-02-25T18:04:50Z","snapshot_observed_at":"2026-08-15T07:22:16.346093Z","submitted_at":"2025-01-08T19:03:17Z","title":"Utility-inspired Reward Transformations Improve Reinforcement Learning Training of Language Models","version":2},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-10T21:31:45.626337Z"},"links":{"cited_paper":"/paper/2403.08295","citing_paper":"/paper/2501.06248"},"observation_digest":"sha256:5a53a3f6acdac6a2ff9e4b98ed69470c7256a9ab704ab6797ca8ce0b0bd9c698","observation_id":"1c32782a-3e91-42a1-9c00-e763f65a879d","resolution":{"observed_at":"2026-08-10T21:31:45.626337Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.01704","last_updated":"2024-12-16T11:03:31Z","snapshot_observed_at":"2026-08-16T14:24:43.796489Z","submitted_at":"2024-01-24T22:22:00Z","title":"Steering Language Models with Game-Theoretic Solvers","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.01704","snapshot_observed_at":"2026-08-10T21:31:45.630739Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.06248","last_updated":"2025-02-25T18:04:50Z","snapshot_observed_at":"2026-08-15T07:22:16.346093Z","submitted_at":"2025-01-08T19:03:17Z","title":"Utility-inspired Reward Transformations Improve Reinforcement Learning Training of Language Models","version":2},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-10T21:31:45.630739Z"},"links":{"cited_paper":"/paper/2402.01704","citing_paper":"/paper/2501.06248"},"observation_digest":"sha256:e8ebc9caa49dcc361a58c2953b7bbc4adecfbef07b533f652678b0fc332dd47f","observation_id":"12272422-9d9d-4b21-a3ac-c2ff4ce161fb","resolution":{"observed_at":"2026-08-10T21:31:45.630739Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.14375","last_updated":"2022-09-28T19:04:43Z","snapshot_observed_at":"2026-08-16T09:29:21.586810Z","submitted_at":"2022-09-28T19:04:43Z","title":"Improving alignment of dialogue agents via targeted human judgements","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.14375","snapshot_observed_at":"2026-08-10T21:31:45.635195Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.06248","last_updated":"2025-02-25T18:04:50Z","snapshot_observed_at":"2026-08-15T07:22:16.346093Z","submitted_at":"2025-01-08T19:03:17Z","title":"Utility-inspired Reward Transformations Improve Reinforcement Learning Training of Language Models","version":2},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-10T21:31:45.635195Z"},"links":{"cited_paper":"/paper/2209.14375","citing_paper":"/paper/2501.06248"},"observation_digest":"sha256:73ae7659286696e24d0a8bda0d23677021fa02a529dfdc8bffaba6caa237f2c3","observation_id":"24db5438-2529-4b7c-8f0c-ccc38c6f2f56","resolution":{"observed_at":"2026-08-10T21:31:45.635195Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.09139","last_updated":"2023-10-13T14:27:21Z","snapshot_observed_at":"2026-08-16T14:52:20.147040Z","submitted_at":"2023-10-13T14:27:21Z","title":"The Consensus Game: Language Model Generation via Equilibrium Search","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.09139","snapshot_observed_at":"2026-08-10T21:31:45.639950Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.06248","last_updated":"2025-02-25T18:04:50Z","snapshot_observed_at":"2026-08-15T07:22:16.346093Z","submitted_at":"2025-01-08T19:03:17Z","title":"Utility-inspired Reward Transformations Improve Reinforcement Learning Training of Language Models","version":2},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-10T21:31:45.639950Z"},"links":{"cited_paper":"/paper/2310.09139","citing_paper":"/paper/2501.06248"},"observation_digest":"sha256:61cb4612644e60b0c3e4e74c94d832a48bf3550c6bcb663b581d063860e46924","observation_id":"6080f8c3-ea81-4161-ad10-30f11ebf0a5e","resolution":{"observed_at":"2026-08-10T21:31:45.639950Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:31:46.237350Z","title":null,"venue":null,"work_id":"9658619b-abda-4638-8ffc-cb1aab75457d","year":2018},"citing_paper":{"arxiv_id":"2501.06248","last_updated":"2025-02-25T18:04:50Z","snapshot_observed_at":"2026-08-15T07:22:16.346093Z","submitted_at":"2025-01-08T19:03:17Z","title":"Utility-inspired Reward Transformations Improve Reinforcement Learning Training of Language Models","version":2},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-10T21:31:45.644489Z"},"links":{"citing_paper":"/paper/2501.06248"},"observation_digest":"sha256:062f162cbcb8849c8bb1c5810d163a5385db8705988b062cbfa4b429840de843","observation_id":"c3d976a8-3a21-4061-9a45-7ad1402a7f05","resolution":{"observed_at":"2026-08-10T21:31:46.242306Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.04373","last_updated":"2023-10-10T15:01:11Z","snapshot_observed_at":"2026-08-16T14:54:24.706600Z","submitted_at":"2023-10-06T16:59:17Z","title":"Confronting Reward Model Overoptimization with Constrained RLHF","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.04373","snapshot_observed_at":"2026-08-10T21:31:45.648887Z","title":"Singh, DJ Strouse, Tuomas Sandholm, Ruslan Salakhutdinov, Anca D","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.06248","last_updated":"2025-02-25T18:04:50Z","snapshot_observed_at":"2026-08-15T07:22:16.346093Z","submitted_at":"2025-01-08T19:03:17Z","title":"Utility-inspired Reward Transformations Improve Reinforcement Learning Training of Language Models","version":2},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-10T21:31:45.648887Z"},"links":{"cited_paper":"/paper/2310.04373","citing_paper":"/paper/2501.06248"},"observation_digest":"sha256:1957af49af1e98f8e5afe3b3d8ea9b6cedc6aae627bb9d595001f5a973f473a2","observation_id":"23e0c1d8-1691-480e-baa4-8a0aa3aa6c1a","resolution":{"observed_at":"2026-08-10T21:31:45.648887Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.00886","last_updated":"2024-06-11T16:25:52Z","snapshot_observed_at":"2026-08-16T14:38:21.874572Z","submitted_at":"2023-12-01T19:26:23Z","title":"Nash Learning from Human Feedback","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.00886","snapshot_observed_at":"2026-08-10T21:31:45.654182Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.06248","last_updated":"2025-02-25T18:04:50Z","snapshot_observed_at":"2026-08-15T07:22:16.346093Z","submitted_at":"2025-01-08T19:03:17Z","title":"Utility-inspired Reward Transformations Improve Reinforcement Learning Training of Language Models","version":2},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-10T21:31:45.654182Z"},"links":{"cited_paper":"/paper/2312.00886","citing_paper":"/paper/2501.06248"},"observation_digest":"sha256:c34e62030d363727ed87f257fa944d141074a4c0ef2c514da7812ec90eb4ddbb","observation_id":"4cfdc89b-b94b-4f18-8c90-3004031e06b8","resolution":{"observed_at":"2026-08-10T21:31:45.654182Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.17700","last_updated":"2024-10-30T21:24:32Z","snapshot_observed_at":"2026-08-16T21:32:40.130981Z","submitted_at":"2024-05-27T23:16:52Z","title":"Learning Social Welfare Functions","version":2},"cited_work":{"arxiv_id":"2405.17700","doi":null,"metadata_source":"pith","pith_arxiv_id":"2405.17700","snapshot_observed_at":"2026-08-10T21:31:45.899352Z","title":"Learning Social Welfare Functions","venue":"cs.GT","work_id":"46322b08-feb4-49b5-8225-f4f0b654db24","year":2024},"citing_paper":{"arxiv_id":"2501.06248","last_updated":"2025-02-25T18:04:50Z","snapshot_observed_at":"2026-08-15T07:22:16.346093Z","submitted_at":"2025-01-08T19:03:17Z","title":"Utility-inspired Reward Transformations Improve Reinforcement Learning Training of Language Models","version":2},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-10T21:31:45.658803Z"},"links":{"cited_paper":"/paper/2405.17700","citing_paper":"/paper/2501.06248"},"observation_digest":"sha256:33994a4e7d4d94d656d8d22af6bae5087c150188372fe77c6472cba6ee760aa1","observation_id":"1b4998d3-5525-4a81-abfd-67e7a4ba4e99","resolution":{"observed_at":"2026-08-10T21:31:45.906234Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:31:46.222900Z","title":null,"venue":null,"work_id":"0e68964c-c956-4f9d-9805-aa9a296901de","year":2021},"citing_paper":{"arxiv_id":"2501.06248","last_updated":"2025-02-25T18:04:50Z","snapshot_observed_at":"2026-08-15T07:22:16.346093Z","submitted_at":"2025-01-08T19:03:17Z","title":"Utility-inspired Reward Transformations Improve Reinforcement Learning Training of Language Models","version":2},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-10T21:31:45.663300Z"},"links":{"citing_paper":"/paper/2501.06248"},"observation_digest":"sha256:4dbfd3e91c7bbe735fadb6e1c69a292ca7b0742f6eda69a4a708b85a2e60806c","observation_id":"847d409e-a360-4a39-83a3-f8fdf8999ddb","resolution":{"observed_at":"2026-08-10T21:31:46.227446Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:31:46.207714Z","title":null,"venue":null,"work_id":"8207f544-2e74-45c6-8d0d-3a81be5006e1","year":1978},"citing_paper":{"arxiv_id":"2501.06248","last_updated":"2025-02-25T18:04:50Z","snapshot_observed_at":"2026-08-15T07:22:16.346093Z","submitted_at":"2025-01-08T19:03:17Z","title":"Utility-inspired Reward Transformations Improve Reinforcement Learning Training of Language Models","version":2},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-10T21:31:45.667488Z"},"links":{"citing_paper":"/paper/2501.06248"},"observation_digest":"sha256:290e65ae5373ac1add0626052239e18d59d545877b6fcd2f1ff72aa9f4ef4545","observation_id":"771fc87a-285d-4986-bfda-c994e177d059","resolution":{"observed_at":"2026-08-10T21:31:46.212247Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:31:46.193144Z","title":null,"venue":null,"work_id":"ea511251-ca01-4c94-9b23-4fb05b62d85c","year":2009},"citing_paper":{"arxiv_id":"2501.06248","last_updated":"2025-02-25T18:04:50Z","snapshot_observed_at":"2026-08-15T07:22:16.346093Z","submitted_at":"2025-01-08T19:03:17Z","title":"Utility-inspired Reward Transformations Improve Reinforcement Learning Training of Language Models","version":2},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-10T21:31:45.672008Z"},"links":{"citing_paper":"/paper/2501.06248"},"observation_digest":"sha256:7d032ab565b7e1fc19372f635e06206df4b82b890b935bb486930dcbda246b6c","observation_id":"b1bd732e-37d6-44c9-aa74-bade1ffe93d1","resolution":{"observed_at":"2026-08-10T21:31:46.197705Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:31:46.178366Z","title":null,"venue":null,"work_id":"6c6f3a85-6d06-4237-9390-c60156b82ee4","year":2024},"citing_paper":{"arxiv_id":"2501.06248","last_updated":"2025-02-25T18:04:50Z","snapshot_observed_at":"2026-08-15T07:22:16.346093Z","submitted_at":"2025-01-08T19:03:17Z","title":"Utility-inspired Reward Transformations Improve Reinforcement Learning Training of Language Models","version":2},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-10T21:31:45.676572Z"},"links":{"citing_paper":"/paper/2501.06248"},"observation_digest":"sha256:262d31d1d0526e0e8da2634838b0ca7a7cedbd9d6128c33aa92518dc540d14a5","observation_id":"ddb1ab5c-24e8-42e3-bc45-a5ee8f733e34","resolution":{"observed_at":"2026-08-10T21:31:46.183274Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-08-15T20:26:32.102285Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-10T21:31:45.681223Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2501.06248","last_updated":"2025-02-25T18:04:50Z","snapshot_observed_at":"2026-08-15T07:22:16.346093Z","submitted_at":"2025-01-08T19:03:17Z","title":"Utility-inspired Reward Transformations Improve Reinforcement Learning Training of Language Models","version":2},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-10T21:31:45.681223Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2501.06248"},"observation_digest":"sha256:c90e2ff68f6e2a5057a60849b08c76df2928aad9b64b36923750e925067b330c","observation_id":"65e807e5-2b58-4273-b5a1-8043d6d25af1","resolution":{"observed_at":"2026-08-10T21:31:45.681223Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.03716","last_updated":"2024-07-10T23:15:49Z","snapshot_observed_at":"2026-08-16T14:54:43.078629Z","submitted_at":"2023-10-05T17:38:28Z","title":"A Long Way to Go: Investigating Length Correlations in RLHF","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.03716","snapshot_observed_at":"2026-08-10T21:31:45.685491Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.06248","last_updated":"2025-02-25T18:04:50Z","snapshot_observed_at":"2026-08-15T07:22:16.346093Z","submitted_at":"2025-01-08T19:03:17Z","title":"Utility-inspired Reward Transformations Improve Reinforcement Learning Training of Language Models","version":2},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-10T21:31:45.685491Z"},"links":{"cited_paper":"/paper/2310.03716","citing_paper":"/paper/2501.06248"},"observation_digest":"sha256:66bcbd12bc22d4df15a00ee3c5f2b39582cf570c586c829573f9962f78029698","observation_id":"571b9802-8a55-474e-81c0-c2e5a4ec0f20","resolution":{"observed_at":"2026-08-10T21:31:45.685491Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:31:45.690199Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2501.06248","last_updated":"2025-02-25T18:04:50Z","snapshot_observed_at":"2026-08-15T07:22:16.346093Z","submitted_at":"2025-01-08T19:03:17Z","title":"Utility-inspired Reward Transformations Improve Reinforcement Learning Training of Language Models","version":2},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-10T21:31:45.690199Z"},"links":{"citing_paper":"/paper/2501.06248"},"observation_digest":"sha256:a84b7b3a478f9e6a2265a98a72b01279c5f9d046e39858b7e54b2dd274a630d0","observation_id":"b86165bb-7e5f-458a-a718-31a4d8330e34","resolution":{"observed_at":"2026-08-10T21:31:45.690199Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.04056","last_updated":"2024-06-13T14:45:36Z","snapshot_observed_at":"2026-08-16T14:29:02.993783Z","submitted_at":"2024-01-08T17:55:02Z","title":"A Minimaximalist Approach to Reinforcement Learning from Human Feedback","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.04056","snapshot_observed_at":"2026-08-10T21:31:45.694507Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.06248","last_updated":"2025-02-25T18:04:50Z","snapshot_observed_at":"2026-08-15T07:22:16.346093Z","submitted_at":"2025-01-08T19:03:17Z","title":"Utility-inspired Reward Transformations Improve Reinforcement Learning Training of Language Models","version":2},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-10T21:31:45.694507Z"},"links":{"cited_paper":"/paper/2401.04056","citing_paper":"/paper/2501.06248"},"observation_digest":"sha256:efa8179ff184fcd5f7c4ba06f17598bac9470784e9b44bae6eb4cc631ede53aa","observation_id":"e699ef17-cf16-4f60-a1e9-a2a258580c43","resolution":{"observed_at":"2026-08-10T21:31:45.694507Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.03689","last_updated":"2023-12-06T18:53:01Z","snapshot_observed_at":"2026-08-17T05:00:41.701837Z","submitted_at":"2023-12-06T18:53:01Z","title":"Evaluating and Mitigating Discrimination in Language Model Decisions","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.03689","snapshot_observed_at":"2026-08-10T21:31:45.698903Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.06248","last_updated":"2025-02-25T18:04:50Z","snapshot_observed_at":"2026-08-15T07:22:16.346093Z","submitted_at":"2025-01-08T19:03:17Z","title":"Utility-inspired Reward Transformations Improve Reinforcement Learning Training of Language Models","version":2},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-10T21:31:45.698903Z"},"links":{"cited_paper":"/paper/2312.03689","citing_paper":"/paper/2501.06248"},"observation_digest":"sha256:21b4116c30e9e5ac874fb36f47313817688a1a58e4fe9287b3b223443a53a7a8","observation_id":"aab78833-519c-4606-8f87-c64c2f219b4b","resolution":{"observed_at":"2026-08-10T21:31:45.698903Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:31:46.153269Z","title":null,"venue":null,"work_id":"d986819c-b93c-4fcb-b787-489c56221903","year":1961},"citing_paper":{"arxiv_id":"2501.06248","last_updated":"2025-02-25T18:04:50Z","snapshot_observed_at":"2026-08-15T07:22:16.346093Z","submitted_at":"2025-01-08T19:03:17Z","title":"Utility-inspired Reward Transformations Improve Reinforcement Learning Training of Language Models","version":2},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-10T21:31:45.703389Z"},"links":{"citing_paper":"/paper/2501.06248"},"observation_digest":"sha256:4592219086cd7025875ae2ec103209e1c2f8d3ecd6746d5bb5f4440f122c080c","observation_id":"e46d02ab-af9a-4a41-91e5-acf244c16eeb","resolution":{"observed_at":"2026-08-10T21:31:46.158280Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.10817","last_updated":"2024-07-15T15:33:45Z","snapshot_observed_at":"2026-08-16T13:34:06.565941Z","submitted_at":"2024-07-15T15:33:45Z","title":"Foundational Autoraters: Taming Large Language Models for Better Automatic Evaluation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.10817","snapshot_observed_at":"2026-08-10T21:31:45.707647Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.06248","last_updated":"2025-02-25T18:04:50Z","snapshot_observed_at":"2026-08-15T07:22:16.346093Z","submitted_at":"2025-01-08T19:03:17Z","title":"Utility-inspired Reward Transformations Improve Reinforcement Learning Training of Language Models","version":2},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-10T21:31:45.707647Z"},"links":{"cited_paper":"/paper/2407.10817","citing_paper":"/paper/2501.06248"},"observation_digest":"sha256:0755d260f3c8348d6afe5b4f3450dee0f3eafdec5e181a3cdbf8a08fb600462c","observation_id":"97accfb3-d797-48ae-9bd5-3cb04c4287d0","resolution":{"observed_at":"2026-08-10T21:31:45.707647Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.00742","last_updated":"2024-07-19T05:12:15Z","snapshot_observed_at":"2026-08-16T14:22:26.545508Z","submitted_at":"2024-02-01T16:39:28Z","title":"Transforming and Combining Rewards for Aligning Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.00742","snapshot_observed_at":"2026-08-10T21:31:45.712536Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.06248","last_updated":"2025-02-25T18:04:50Z","snapshot_observed_at":"2026-08-15T07:22:16.346093Z","submitted_at":"2025-01-08T19:03:17Z","title":"Utility-inspired Reward Transformations Improve Reinforcement Learning Training of Language Models","version":2},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-10T21:31:45.712536Z"},"links":{"cited_paper":"/paper/2402.00742","citing_paper":"/paper/2501.06248"},"observation_digest":"sha256:a428176712fe08002348db8b8bb69d30718aef1eb549b32683dbda02793b4841","observation_id":"a80e9000-c40a-4121-964b-61f1b9dc0c67","resolution":{"observed_at":"2026-08-10T21:31:45.712536Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2112.04359","last_updated":"2021-12-08T16:09:48Z","snapshot_observed_at":"2026-08-09T15:17:43.394064Z","submitted_at":"2021-12-08T16:09:48Z","title":"Ethical and social risks of harm from Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.04359","snapshot_observed_at":"2026-08-10T21:31:45.716752Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.06248","last_updated":"2025-02-25T18:04:50Z","snapshot_observed_at":"2026-08-15T07:22:16.346093Z","submitted_at":"2025-01-08T19:03:17Z","title":"Utility-inspired Reward Transformations Improve Reinforcement Learning Training of Language Models","version":2},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-10T21:31:45.716752Z"},"links":{"cited_paper":"/paper/2112.04359","citing_paper":"/paper/2501.06248"},"observation_digest":"sha256:62ce90a83878aedbad285c1241caea4dad727006b94d62fb28c8ba512f020980","observation_id":"a26d0694-f2fd-4af0-b501-231962d711fe","resolution":{"observed_at":"2026-08-10T21:31:45.716752Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:31:45.721017Z","title":null,"venue":null,"work_id":null,"year":1992},"citing_paper":{"arxiv_id":"2501.06248","last_updated":"2025-02-25T18:04:50Z","snapshot_observed_at":"2026-08-15T07:22:16.346093Z","submitted_at":"2025-01-08T19:03:17Z","title":"Utility-inspired Reward Transformations Improve Reinforcement Learning Training of Language Models","version":2},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-10T21:31:45.721017Z"},"links":{"citing_paper":"/paper/2501.06248"},"observation_digest":"sha256:14c9099e6c2639886e49903662a459cf3485b0591088935e982fdebac812dfca","observation_id":"9c7c0d23-7c6c-47ca-9aef-7828554af0ff","resolution":{"observed_at":"2026-08-10T21:31:45.721017Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.01693","last_updated":"2023-10-30T06:34:35Z","snapshot_observed_at":"2026-08-16T15:27:03.249856Z","submitted_at":"2023-06-02T17:11:37Z","title":"Fine-Grained Human Feedback Gives Better Rewards for Language Model Training","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.01693","snapshot_observed_at":"2026-08-10T21:31:45.725087Z","title":"Smith, Mari Ostendorf, and Hannaneh Hajishirzi","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.06248","last_updated":"2025-02-25T18:04:50Z","snapshot_observed_at":"2026-08-15T07:22:16.346093Z","submitted_at":"2025-01-08T19:03:17Z","title":"Utility-inspired Reward Transformations Improve Reinforcement Learning Training of Language Models","version":2},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-10T21:31:45.725087Z"},"links":{"cited_paper":"/paper/2306.01693","citing_paper":"/paper/2501.06248"},"observation_digest":"sha256:81cd3f4944aefd32e5461a709038691300c1d576badc2cd788aca627a6a17bd9","observation_id":"146e3566-1b63-4247-bd29-bb6993028f04","resolution":{"observed_at":"2026-08-10T21:31:45.725087Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:31:45.729401Z","title":"online\" 'onlinestring :=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.06248","last_updated":"2025-02-25T18:04:50Z","snapshot_observed_at":"2026-08-15T07:22:16.346093Z","submitted_at":"2025-01-08T19:03:17Z","title":"Utility-inspired Reward Transformations Improve Reinforcement Learning Training of Language Models","version":2},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-10T21:31:45.729401Z"},"links":{"citing_paper":"/paper/2501.06248"},"observation_digest":"sha256:837d5a50c3a76a741749a77d774cc20c700ffe739ce03b625eae7e51c3b38a3d","observation_id":"7a496f50-7965-4c1a-b2dc-cddd7aa76bc5","resolution":{"observed_at":"2026-08-10T21:31:45.729401Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:31:45.734231Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.06248","last_updated":"2025-02-25T18:04:50Z","snapshot_observed_at":"2026-08-15T07:22:16.346093Z","submitted_at":"2025-01-08T19:03:17Z","title":"Utility-inspired Reward Transformations Improve Reinforcement Learning Training of Language Models","version":2},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-10T21:31:45.734231Z"},"links":{"citing_paper":"/paper/2501.06248"},"observation_digest":"sha256:221602f19eb19ecfc031938d2929d4ad3c5c50d7a4a844a6548b4cfaebce9408","observation_id":"6b515aae-a9cf-4cbc-919a-138da253c004","resolution":{"observed_at":"2026-08-10T21:31:45.734231Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2501.06248","last_updated":"2025-02-25T18:04:50Z","latest_version":2,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-15T07:22:16.346093Z","submitted_at":"2025-01-08T19:03:17Z","title":"Utility-inspired Reward Transformations Improve Reinforcement Learning Training of Language Models"},"reference_resolution":{"displayed":33,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":31,"verified_exact":2,"verified_fuzzy":0},"total_outbound_references":33},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"thesis":"As of 17 August 2026, this Paper Citation Record lists 33 of 33 outbound references and 0 inbound Pith citation observations for arXiv:2501.06248."}