{"as_of":"2026-08-10T02:13:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:50a1842f36f0a1fc1438a263dd001a5a53bfcbc9ff1304744887980219317312","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":22,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":22,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":22,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":22,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T13:21:41.769204Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"arxiv_reference","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":0,"observed_at":"2026-08-05T02:28:24.338817Z","source":"arxiv_reference"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2502.18770","last_updated":"2026-08-06T10:33:17Z","snapshot_observed_at":"2026-08-10T00:26:19.457052Z","submitted_at":"2025-02-26T02:57:59Z","title":"Reward Shaping to Mitigate Reward Hacking in RLHF","version":6},"cited_work":{"arxiv_id":"2502.18770","doi":"10.48550/arxiv.2502.18770","metadata_source":"arxiv_reference","pith_arxiv_id":"2502.18770","snapshot_observed_at":"2026-08-07T01:35:47.288139Z","title":"Reward shaping to mitigate reward hacking in rlhf","venue":"ArXiv.org","work_id":"ebf5fa0e-3997-4dcc-922f-354e98be03dc","year":2026},"citing_paper":{"arxiv_id":"2502.13957","last_updated":"2026-05-16T17:37:22Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-19T18:56:03Z","title":"Supervising the search process produces reliable and generalizable information-seeking agents","version":3},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-23T02:18:27.204122Z"},"links":{"cited_paper":"/paper/2502.18770","citing_paper":"/paper/2502.13957"},"observation_digest":"sha256:8de89ab31b1b60fbf15bc69bfba017c8898c2dd2f52276f07024cc5782ef6010","observation_id":"d48a086d-209a-4c6b-8926-5cf6b54b797e","resolution":{"observed_at":"2026-08-07T01:35:47.288139Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.18770","last_updated":"2026-08-06T10:33:17Z","snapshot_observed_at":"2026-08-10T00:26:19.457052Z","submitted_at":"2025-02-26T02:57:59Z","title":"Reward Shaping to Mitigate Reward Hacking in RLHF","version":6},"cited_work":{"arxiv_id":"2502.18770","doi":"10.48550/arxiv.2502.18770","metadata_source":"arxiv_reference","pith_arxiv_id":"2502.18770","snapshot_observed_at":"2026-08-07T01:35:47.288139Z","title":"Reward shaping to mitigate reward hacking in rlhf","venue":"ArXiv.org","work_id":"ebf5fa0e-3997-4dcc-922f-354e98be03dc","year":2026},"citing_paper":{"arxiv_id":"2502.17419","last_updated":"2025-06-25T02:24:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-24T18:50:52Z","title":"From System 1 to System 2: A Survey of Reasoning Large Language Models","version":6},"reference_index":170,"source":"pdf_text","source_observed_at":"2026-05-13T01:36:23.845366Z"},"links":{"cited_paper":"/paper/2502.18770","citing_paper":"/paper/2502.17419"},"observation_digest":"sha256:5efa36d7a2b01483df205fcbf725edbb153ce3f940e84f7f28530f109b064d57","observation_id":"58c6321b-7665-4423-8b27-86437a460e6d","resolution":{"observed_at":"2026-08-07T01:35:47.288139Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.18770","last_updated":"2026-08-06T10:33:17Z","snapshot_observed_at":"2026-08-10T00:26:19.457052Z","submitted_at":"2025-02-26T02:57:59Z","title":"Reward Shaping to Mitigate Reward Hacking in RLHF","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.18770","snapshot_observed_at":"2026-08-07T13:21:41.769204Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.00042","last_updated":"2025-05-28T08:39:35Z","snapshot_observed_at":"2026-08-07T13:12:36.585457Z","submitted_at":"2025-05-28T08:39:35Z","title":"Enhancing Tool Learning in Large Language Models with Hierarchical Error Checklists","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-07T13:21:41.769204Z"},"links":{"cited_paper":"/paper/2502.18770","citing_paper":"/paper/2506.00042"},"observation_digest":"sha256:0558d505de4fc6c7a817cfdeb3e2163d8943a3e0112dce7de1338365701f04f9","observation_id":"e947c3dd-4fd3-4e12-876b-9d57f2af9dbf","resolution":{"observed_at":"2026-08-07T13:21:41.769204Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.18770","last_updated":"2026-08-06T10:33:17Z","snapshot_observed_at":"2026-08-10T00:26:19.457052Z","submitted_at":"2025-02-26T02:57:59Z","title":"Reward Shaping to Mitigate Reward Hacking in RLHF","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.18770","snapshot_observed_at":"2026-08-07T11:04:06.897214Z","title":"Reward shaping to mitigate reward hacking in rlhf,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.03637","last_updated":"2025-07-07T09:53:22Z","snapshot_observed_at":"2026-08-08T03:23:19.289933Z","submitted_at":"2025-06-04T07:30:16Z","title":"RewardAnything: Generalizable Principle-Following Reward Models","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T11:04:06.897214Z"},"links":{"cited_paper":"/paper/2502.18770","citing_paper":"/paper/2506.03637"},"observation_digest":"sha256:6c022c2fffcebfa0a29703ed3a78466a972e7c4de184b880d218cad22df3e445","observation_id":"5c3df9b4-277a-4135-b4c4-75ffb9785030","resolution":{"observed_at":"2026-08-07T11:04:06.897214Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.18770","last_updated":"2026-08-06T10:33:17Z","snapshot_observed_at":"2026-08-10T00:26:19.457052Z","submitted_at":"2025-02-26T02:57:59Z","title":"Reward Shaping to Mitigate Reward Hacking in RLHF","version":6},"cited_work":{"arxiv_id":"2502.18770","doi":"10.48550/arxiv.2502.18770","metadata_source":"arxiv_reference","pith_arxiv_id":"2502.18770","snapshot_observed_at":"2026-08-07T01:35:47.288139Z","title":"Reward shaping to mitigate reward hacking in rlhf","venue":"ArXiv.org","work_id":"ebf5fa0e-3997-4dcc-922f-354e98be03dc","year":2026},"citing_paper":{"arxiv_id":"2508.19652","last_updated":"2026-04-27T16:28:37Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-08-27T08:01:03Z","title":"Self-Rewarding Vision-Language Model via Reasoning Decomposition","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-18T21:03:31.606674Z"},"links":{"cited_paper":"/paper/2502.18770","citing_paper":"/paper/2508.19652"},"observation_digest":"sha256:9bf95e9be38ed2b6330d409dcaf5bbbd090de63f0fa7aaccfa0bfc15045e22b8","observation_id":"f1f2f615-d4f8-4f43-a686-c92943506c4b","resolution":{"observed_at":"2026-08-07T01:35:47.288139Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.18770","last_updated":"2026-08-06T10:33:17Z","snapshot_observed_at":"2026-08-10T00:26:19.457052Z","submitted_at":"2025-02-26T02:57:59Z","title":"Reward Shaping to Mitigate Reward Hacking in RLHF","version":6},"cited_work":{"arxiv_id":"2502.18770","doi":"10.48550/arxiv.2502.18770","metadata_source":"arxiv_reference","pith_arxiv_id":"2502.18770","snapshot_observed_at":"2026-08-07T01:35:47.288139Z","title":"Reward shaping to mitigate reward hacking in rlhf","venue":"ArXiv.org","work_id":"ebf5fa0e-3997-4dcc-922f-354e98be03dc","year":2026},"citing_paper":{"arxiv_id":"2601.21350","last_updated":"2026-05-16T02:45:10Z","snapshot_observed_at":"2026-07-06T22:43:26.250071Z","submitted_at":"2026-01-29T07:18:45Z","title":"Factored Causal Representation Learning for Robust Reward Modeling in RLHF","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-21T14:18:33.768962Z"},"links":{"cited_paper":"/paper/2502.18770","citing_paper":"/paper/2601.21350"},"observation_digest":"sha256:348418a636f698383f83679d734db6f0432b7c3efece8eae3b641ca13eaae3ed","observation_id":"1e5c7b63-c8d2-41ef-ba7f-41347e6abf8c","resolution":{"observed_at":"2026-08-07T01:35:47.288139Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.18770","last_updated":"2026-08-06T10:33:17Z","snapshot_observed_at":"2026-08-10T00:26:19.457052Z","submitted_at":"2025-02-26T02:57:59Z","title":"Reward Shaping to Mitigate Reward Hacking in RLHF","version":6},"cited_work":{"arxiv_id":"2502.18770","doi":"10.48550/arxiv.2502.18770","metadata_source":"arxiv_reference","pith_arxiv_id":"2502.18770","snapshot_observed_at":"2026-08-07T01:35:47.288139Z","title":"Reward shaping to mitigate reward hacking in rlhf","venue":"ArXiv.org","work_id":"ebf5fa0e-3997-4dcc-922f-354e98be03dc","year":2026},"citing_paper":{"arxiv_id":"2604.17328","last_updated":"2026-05-23T14:02:35Z","snapshot_observed_at":"2026-07-06T23:04:28.260463Z","submitted_at":"2026-04-19T08:48:46Z","title":"Rethinking the Comparison Unit in Sequence-Level Reinforcement Learning: An Equal-Length Paired Training Framework from Loss Correction to Sample Construction","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-05-10T06:23:14.905706Z"},"links":{"cited_paper":"/paper/2502.18770","citing_paper":"/paper/2604.17328"},"observation_digest":"sha256:513e63f9877f6b5df8deab14b1227a649dc05fc1cd03d4498928c2cf9f2ab9f3","observation_id":"f423b48c-8cd7-4e5b-85fb-08c49e2b8e17","resolution":{"observed_at":"2026-08-07T01:35:47.288139Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.18770","last_updated":"2026-08-06T10:33:17Z","snapshot_observed_at":"2026-08-10T00:26:19.457052Z","submitted_at":"2025-02-26T02:57:59Z","title":"Reward Shaping to Mitigate Reward Hacking in RLHF","version":6},"cited_work":{"arxiv_id":"2502.18770","doi":"10.48550/arxiv.2502.18770","metadata_source":"arxiv_reference","pith_arxiv_id":"2502.18770","snapshot_observed_at":"2026-08-07T01:35:47.288139Z","title":"Reward shaping to mitigate reward hacking in rlhf","venue":"ArXiv.org","work_id":"ebf5fa0e-3997-4dcc-922f-354e98be03dc","year":2026},"citing_paper":{"arxiv_id":"2604.21268","last_updated":"2026-04-23T04:23:31Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-23T04:23:31Z","title":"Measure Twice, Click Once: Co-evolving Proposer and Visual Critic via Reinforcement Learning for GUI Grounding","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-05-09T23:05:05.251150Z"},"links":{"cited_paper":"/paper/2502.18770","citing_paper":"/paper/2604.21268"},"observation_digest":"sha256:3ce94576fbc35452669c056fa43e688a0f52afa26398c5392a9e02b12f9a94d6","observation_id":"e0aa7ce6-4486-46d5-b0d7-cff2b43fe244","resolution":{"observed_at":"2026-08-07T01:35:47.288139Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.18770","last_updated":"2026-08-06T10:33:17Z","snapshot_observed_at":"2026-08-10T00:26:19.457052Z","submitted_at":"2025-02-26T02:57:59Z","title":"Reward Shaping to Mitigate Reward Hacking in RLHF","version":6},"cited_work":{"arxiv_id":"2502.18770","doi":"10.48550/arxiv.2502.18770","metadata_source":"arxiv_reference","pith_arxiv_id":"2502.18770","snapshot_observed_at":"2026-08-07T01:35:47.288139Z","title":"Reward shaping to mitigate reward hacking in rlhf","venue":"ArXiv.org","work_id":"ebf5fa0e-3997-4dcc-922f-354e98be03dc","year":2026},"citing_paper":{"arxiv_id":"2605.04431","last_updated":"2026-05-06T02:50:00Z","snapshot_observed_at":"2026-07-06T23:17:13.770090Z","submitted_at":"2026-05-06T02:50:00Z","title":"Towards Robust LLM Post-Training: Automatic Failure Management for Reinforcement Fine-Tuning","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-08T18:19:41.302164Z"},"links":{"cited_paper":"/paper/2502.18770","citing_paper":"/paper/2605.04431"},"observation_digest":"sha256:8f9d6fa1fac8ca1fa13ce5275fbaa78bbd9416cfd53ce7a1a5f8c02d71c0d580","observation_id":"a496afa7-0edb-44c0-95fa-ff04bd50f10b","resolution":{"observed_at":"2026-08-07T01:35:47.288139Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.18770","last_updated":"2026-08-06T10:33:17Z","snapshot_observed_at":"2026-08-10T00:26:19.457052Z","submitted_at":"2025-02-26T02:57:59Z","title":"Reward Shaping to Mitigate Reward Hacking in RLHF","version":6},"cited_work":{"arxiv_id":"2502.18770","doi":"10.48550/arxiv.2502.18770","metadata_source":"arxiv_reference","pith_arxiv_id":"2502.18770","snapshot_observed_at":"2026-08-07T01:35:47.288139Z","title":"Reward shaping to mitigate reward hacking in rlhf","venue":"ArXiv.org","work_id":"ebf5fa0e-3997-4dcc-922f-354e98be03dc","year":2026},"citing_paper":{"arxiv_id":"2605.06036","last_updated":"2026-05-07T11:26:04Z","snapshot_observed_at":"2026-08-02T20:51:09.770289Z","submitted_at":"2026-05-07T11:26:04Z","title":"Optimal Transport for LLM Reward Modeling from Noisy Preference","version":1},"reference_index":260,"source":"arxiv_source","source_observed_at":"2026-05-08T14:10:49.634358Z"},"links":{"cited_paper":"/paper/2502.18770","citing_paper":"/paper/2605.06036"},"observation_digest":"sha256:21f8f938b9a56b907af6ffbfa609ea3192eb03ba87725eaa0abd9414556ec982","observation_id":"31879369-3523-4a1d-82b4-7a711302bdb3","resolution":{"observed_at":"2026-08-07T01:35:47.288139Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.18770","last_updated":"2026-08-06T10:33:17Z","snapshot_observed_at":"2026-08-10T00:26:19.457052Z","submitted_at":"2025-02-26T02:57:59Z","title":"Reward Shaping to Mitigate Reward Hacking in RLHF","version":6},"cited_work":{"arxiv_id":"2502.18770","doi":"10.48550/arxiv.2502.18770","metadata_source":"arxiv_reference","pith_arxiv_id":"2502.18770","snapshot_observed_at":"2026-08-07T01:35:47.288139Z","title":"Reward shaping to mitigate reward hacking in rlhf","venue":"ArXiv.org","work_id":"ebf5fa0e-3997-4dcc-922f-354e98be03dc","year":2026},"citing_paper":{"arxiv_id":"2605.08496","last_updated":"2026-05-08T21:21:59Z","snapshot_observed_at":"2026-07-06T23:20:43.010758Z","submitted_at":"2026-05-08T21:21:59Z","title":"Latent Personality Alignment: Improving Harmlessness Without Mentioning Harms","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-12T01:46:49.586630Z"},"links":{"cited_paper":"/paper/2502.18770","citing_paper":"/paper/2605.08496"},"observation_digest":"sha256:9efe5201f8484e4f89b3e198cc26d8c9c59b84cad9a88672e9864a8934035cab","observation_id":"28cb54ed-920c-419c-8d23-2482c8cc6dad","resolution":{"observed_at":"2026-08-07T01:35:47.288139Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.18770","last_updated":"2026-08-06T10:33:17Z","snapshot_observed_at":"2026-08-10T00:26:19.457052Z","submitted_at":"2025-02-26T02:57:59Z","title":"Reward Shaping to Mitigate Reward Hacking in RLHF","version":6},"cited_work":{"arxiv_id":"2502.18770","doi":"10.48550/arxiv.2502.18770","metadata_source":"arxiv_reference","pith_arxiv_id":"2502.18770","snapshot_observed_at":"2026-08-07T01:35:47.288139Z","title":"Reward shaping to mitigate reward hacking in rlhf","venue":"ArXiv.org","work_id":"ebf5fa0e-3997-4dcc-922f-354e98be03dc","year":2026},"citing_paper":{"arxiv_id":"2605.11865","last_updated":"2026-05-12T09:46:26Z","snapshot_observed_at":"2026-07-06T23:23:39.723268Z","submitted_at":"2026-05-12T09:46:26Z","title":"Variance-aware Reward Modeling with Anchor Guidance","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-05-13T05:11:05.546092Z"},"links":{"cited_paper":"/paper/2502.18770","citing_paper":"/paper/2605.11865"},"observation_digest":"sha256:ca572680c14d00c1e3f171123f334c70d2a337b62488b1c4b9d49ee064b2363b","observation_id":"4409e985-2190-4e31-b2d7-ef560d706b26","resolution":{"observed_at":"2026-08-07T01:35:47.288139Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.18770","last_updated":"2026-08-06T10:33:17Z","snapshot_observed_at":"2026-08-10T00:26:19.457052Z","submitted_at":"2025-02-26T02:57:59Z","title":"Reward Shaping to Mitigate Reward Hacking in RLHF","version":6},"cited_work":{"arxiv_id":"2502.18770","doi":"10.48550/arxiv.2502.18770","metadata_source":"arxiv_reference","pith_arxiv_id":"2502.18770","snapshot_observed_at":"2026-08-07T01:35:47.288139Z","title":"Reward shaping to mitigate reward hacking in rlhf","venue":"ArXiv.org","work_id":"ebf5fa0e-3997-4dcc-922f-354e98be03dc","year":2026},"citing_paper":{"arxiv_id":"2605.12474","last_updated":"2026-05-12T17:54:25Z","snapshot_observed_at":"2026-08-03T08:00:52.890954Z","submitted_at":"2026-05-12T17:54:25Z","title":"Reward Hacking in Rubric-Based Reinforcement Learning","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-13T04:08:51.578772Z"},"links":{"cited_paper":"/paper/2502.18770","citing_paper":"/paper/2605.12474"},"observation_digest":"sha256:d15bd27b61e911cd93e0e93b7eb410798ace7772927a39ff7aaa738d0a179b3f","observation_id":"b3fc049c-ece3-453c-8748-63065fc9883b","resolution":{"observed_at":"2026-08-07T01:35:47.288139Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.18770","last_updated":"2026-08-06T10:33:17Z","snapshot_observed_at":"2026-08-10T00:26:19.457052Z","submitted_at":"2025-02-26T02:57:59Z","title":"Reward Shaping to Mitigate Reward Hacking in RLHF","version":6},"cited_work":{"arxiv_id":"2502.18770","doi":"10.48550/arxiv.2502.18770","metadata_source":"arxiv_reference","pith_arxiv_id":"2502.18770","snapshot_observed_at":"2026-08-07T01:35:47.288139Z","title":"Reward shaping to mitigate reward hacking in rlhf","venue":"ArXiv.org","work_id":"ebf5fa0e-3997-4dcc-922f-354e98be03dc","year":2026},"citing_paper":{"arxiv_id":"2605.14220","last_updated":"2026-05-14T00:27:35Z","snapshot_observed_at":"2026-07-06T23:25:39.415637Z","submitted_at":"2026-05-14T00:27:35Z","title":"Diagnosing Training Inference Mismatch in LLM Reinforcement Learning","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-05-15T02:05:44.813341Z"},"links":{"cited_paper":"/paper/2502.18770","citing_paper":"/paper/2605.14220"},"observation_digest":"sha256:ca38c3bdac239d3172ebec661a77fdd3c473be75c6bfd097aa442177fcb4014d","observation_id":"c98675b8-a2c6-45e8-bd29-ddb4c5b20399","resolution":{"observed_at":"2026-08-07T01:35:47.288139Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.18770","last_updated":"2026-08-06T10:33:17Z","snapshot_observed_at":"2026-08-10T00:26:19.457052Z","submitted_at":"2025-02-26T02:57:59Z","title":"Reward Shaping to Mitigate Reward Hacking in RLHF","version":6},"cited_work":{"arxiv_id":"2502.18770","doi":"10.48550/arxiv.2502.18770","metadata_source":"arxiv_reference","pith_arxiv_id":"2502.18770","snapshot_observed_at":"2026-08-07T01:35:47.288139Z","title":"Reward shaping to mitigate reward hacking in rlhf","venue":"ArXiv.org","work_id":"ebf5fa0e-3997-4dcc-922f-354e98be03dc","year":2026},"citing_paper":{"arxiv_id":"2605.18721","last_updated":"2026-05-21T04:23:01Z","snapshot_observed_at":"2026-07-06T23:29:33.702647Z","submitted_at":"2026-05-18T17:50:27Z","title":"General Preference Reinforcement Learning","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-20T12:43:56.522345Z"},"links":{"cited_paper":"/paper/2502.18770","citing_paper":"/paper/2605.18721"},"observation_digest":"sha256:1fb514f3a47adb9bf254c0341b745c153699338316d37316a7092ab880cb2ede","observation_id":"f03a1e6c-f8f9-45b8-b88b-552164449677","resolution":{"observed_at":"2026-08-07T01:35:47.288139Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.18770","last_updated":"2026-08-06T10:33:17Z","snapshot_observed_at":"2026-08-10T00:26:19.457052Z","submitted_at":"2025-02-26T02:57:59Z","title":"Reward Shaping to Mitigate Reward Hacking in RLHF","version":6},"cited_work":{"arxiv_id":"2502.18770","doi":"10.48550/arxiv.2502.18770","metadata_source":"arxiv_reference","pith_arxiv_id":"2502.18770","snapshot_observed_at":"2026-08-07T01:35:47.288139Z","title":"Reward shaping to mitigate reward hacking in rlhf","venue":"ArXiv.org","work_id":"ebf5fa0e-3997-4dcc-922f-354e98be03dc","year":2026},"citing_paper":{"arxiv_id":"2605.18721","last_updated":"2026-05-21T04:23:01Z","snapshot_observed_at":"2026-07-06T23:29:33.702647Z","submitted_at":"2026-05-18T17:50:27Z","title":"General Preference Reinforcement Learning","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-21T07:50:00.963837Z"},"links":{"cited_paper":"/paper/2502.18770","citing_paper":"/paper/2605.18721"},"observation_digest":"sha256:8f7a6a90b87980448edbeaac44b5d1f4249e726275b535c0783c42bc449d5d3c","observation_id":"c4ec532b-ea35-4495-8772-1c98695e82ae","resolution":{"observed_at":"2026-08-07T01:35:47.288139Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.18770","last_updated":"2026-08-06T10:33:17Z","snapshot_observed_at":"2026-08-10T00:26:19.457052Z","submitted_at":"2025-02-26T02:57:59Z","title":"Reward Shaping to Mitigate Reward Hacking in RLHF","version":6},"cited_work":{"arxiv_id":"2502.18770","doi":"10.48550/arxiv.2502.18770","metadata_source":"arxiv_reference","pith_arxiv_id":"2502.18770","snapshot_observed_at":"2026-08-07T01:35:47.288139Z","title":"Reward shaping to mitigate reward hacking in rlhf","venue":"ArXiv.org","work_id":"ebf5fa0e-3997-4dcc-922f-354e98be03dc","year":2026},"citing_paper":{"arxiv_id":"2605.18721","last_updated":"2026-05-21T04:23:01Z","snapshot_observed_at":"2026-07-06T23:29:33.702647Z","submitted_at":"2026-05-18T17:50:27Z","title":"General Preference Reinforcement Learning","version":3},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-22T09:24:39.228616Z"},"links":{"cited_paper":"/paper/2502.18770","citing_paper":"/paper/2605.18721"},"observation_digest":"sha256:6f4983ef61f64b9dbf6a19abc34e7b5e2a51af70d76ad94dfdeabe184318afee","observation_id":"67adf7ce-7aa5-4b17-8c48-c0279bdd6785","resolution":{"observed_at":"2026-08-07T01:35:47.288139Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.18770","last_updated":"2026-08-06T10:33:17Z","snapshot_observed_at":"2026-08-10T00:26:19.457052Z","submitted_at":"2025-02-26T02:57:59Z","title":"Reward Shaping to Mitigate Reward Hacking in RLHF","version":6},"cited_work":{"arxiv_id":"2502.18770","doi":"10.48550/arxiv.2502.18770","metadata_source":"arxiv_reference","pith_arxiv_id":"2502.18770","snapshot_observed_at":"2026-08-07T01:35:47.288139Z","title":"Reward shaping to mitigate reward hacking in rlhf","venue":"ArXiv.org","work_id":"ebf5fa0e-3997-4dcc-922f-354e98be03dc","year":2026},"citing_paper":{"arxiv_id":"2606.10528","last_updated":"2026-06-09T07:57:50Z","snapshot_observed_at":"2026-07-06T23:49:41.940954Z","submitted_at":"2026-06-09T07:57:50Z","title":"Representation-Aware Advantage Estimation: Your Reward Model Provides More Than A Scalar Output","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-06-27T13:39:17.701196Z"},"links":{"cited_paper":"/paper/2502.18770","citing_paper":"/paper/2606.10528"},"observation_digest":"sha256:75d92506b35e378d882cacb00ebaa5394c2820ff23aa089534f7e0361f27b29d","observation_id":"23180915-ff3b-4ee9-a737-6d9700bc46a9","resolution":{"observed_at":"2026-08-07T01:35:47.288139Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.18770","last_updated":"2026-08-06T10:33:17Z","snapshot_observed_at":"2026-08-10T00:26:19.457052Z","submitted_at":"2025-02-26T02:57:59Z","title":"Reward Shaping to Mitigate Reward Hacking in RLHF","version":6},"cited_work":{"arxiv_id":"2502.18770","doi":"10.48550/arxiv.2502.18770","metadata_source":"arxiv_reference","pith_arxiv_id":"2502.18770","snapshot_observed_at":"2026-08-07T01:35:47.288139Z","title":"Reward shaping to mitigate reward hacking in rlhf","venue":"ArXiv.org","work_id":"ebf5fa0e-3997-4dcc-922f-354e98be03dc","year":2026},"citing_paper":{"arxiv_id":"2606.11052","last_updated":"2026-06-09T16:17:19Z","snapshot_observed_at":"2026-08-05T14:17:36.486236Z","submitted_at":"2026-06-09T16:17:19Z","title":"Attention Amnesia in Hybrid LLMs: When CoT Fine-Tuning Breaks Long-Range Recall, and How to Fix It","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-06-27T13:08:57.218711Z"},"links":{"cited_paper":"/paper/2502.18770","citing_paper":"/paper/2606.11052"},"observation_digest":"sha256:be419a7914bd89dcea884467d426aa3d2f6b54c270563aab92d74564a80e71b3","observation_id":"542a30f0-8e1a-428d-8eaf-16dd502c6c43","resolution":{"observed_at":"2026-08-07T01:35:47.288139Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.18770","last_updated":"2026-08-06T10:33:17Z","snapshot_observed_at":"2026-08-10T00:26:19.457052Z","submitted_at":"2025-02-26T02:57:59Z","title":"Reward Shaping to Mitigate Reward Hacking in RLHF","version":6},"cited_work":{"arxiv_id":"2502.18770","doi":"10.48550/arxiv.2502.18770","metadata_source":"arxiv_reference","pith_arxiv_id":"2502.18770","snapshot_observed_at":"2026-08-07T01:35:47.288139Z","title":"Reward shaping to mitigate reward hacking in rlhf","venue":"ArXiv.org","work_id":"ebf5fa0e-3997-4dcc-922f-354e98be03dc","year":2026},"citing_paper":{"arxiv_id":"2606.17682","last_updated":"2026-06-16T08:48:58Z","snapshot_observed_at":"2026-08-01T05:53:08.805029Z","submitted_at":"2026-06-16T08:48:58Z","title":"From Trainee to Trainer: LLM-Designed Training Environment for RL with Multi-Agent Reasoning","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-06-27T00:59:50.038405Z"},"links":{"cited_paper":"/paper/2502.18770","citing_paper":"/paper/2606.17682"},"observation_digest":"sha256:e1a422c877e33e43f32c4e2315ccb8682a8fcc5f4a2e79dd1ddfcb9babc7ad9f","observation_id":"f25422c1-50d3-4e78-8a25-94556b030c76","resolution":{"observed_at":"2026-08-07T01:35:47.288139Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.18770","last_updated":"2026-08-06T10:33:17Z","snapshot_observed_at":"2026-08-10T00:26:19.457052Z","submitted_at":"2025-02-26T02:57:59Z","title":"Reward Shaping to Mitigate Reward Hacking in RLHF","version":6},"cited_work":{"arxiv_id":"2502.18770","doi":"10.48550/arxiv.2502.18770","metadata_source":"arxiv_reference","pith_arxiv_id":"2502.18770","snapshot_observed_at":"2026-08-07T01:35:47.288139Z","title":"Reward shaping to mitigate reward hacking in rlhf","venue":"ArXiv.org","work_id":"ebf5fa0e-3997-4dcc-922f-354e98be03dc","year":2026},"citing_paper":{"arxiv_id":"2606.19818","last_updated":"2026-06-18T05:46:32Z","snapshot_observed_at":"2026-07-06T23:55:05.932014Z","submitted_at":"2026-06-18T05:46:32Z","title":"Uncertainty-Aware Reward Modeling for Stable RLHF","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-06-26T18:14:33.673995Z"},"links":{"cited_paper":"/paper/2502.18770","citing_paper":"/paper/2606.19818"},"observation_digest":"sha256:c59eaf54390b0a3fbff5e5cd69b0c5aac2f10cf6f0c9c73715c2705f2ce1886f","observation_id":"ae675e5a-4070-45e6-a112-598783ebdaa7","resolution":{"observed_at":"2026-08-07T01:35:47.288139Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.18770","last_updated":"2026-08-06T10:33:17Z","snapshot_observed_at":"2026-08-10T00:26:19.457052Z","submitted_at":"2025-02-26T02:57:59Z","title":"Reward Shaping to Mitigate Reward Hacking in RLHF","version":6},"cited_work":{"arxiv_id":"2502.18770","doi":"10.48550/arxiv.2502.18770","metadata_source":"arxiv_reference","pith_arxiv_id":"2502.18770","snapshot_observed_at":"2026-08-07T01:35:47.288139Z","title":"Reward shaping to mitigate reward hacking in rlhf","venue":"ArXiv.org","work_id":"ebf5fa0e-3997-4dcc-922f-354e98be03dc","year":2026},"citing_paper":{"arxiv_id":"2606.25757","last_updated":"2026-06-24T12:31:14Z","snapshot_observed_at":"2026-07-07T00:00:12.737052Z","submitted_at":"2026-06-24T12:31:14Z","title":"OPERA: Aligning Open-Ended Reasoning via Objective Perplexity-based Reinforcement Learning","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-06-25T21:00:37.797967Z"},"links":{"cited_paper":"/paper/2502.18770","citing_paper":"/paper/2606.25757"},"observation_digest":"sha256:744272ffb5787bbeaef83c6a30a08837adedd7c3da28c24539bfc13aff9c5402","observation_id":"0c0ba185-f333-4895-adb9-702110f2cef1","resolution":{"observed_at":"2026-08-07T01:35:47.288139Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2502.18770/citation-record","integrity":"/paper/2502.18770/integrity","json":"/paper/2502.18770/citation-record.json","paper":"/paper/2502.18770"},"outbound":[],"paper":{"arxiv_id":"2502.18770","last_updated":"2026-08-06T10:33:17Z","latest_version":6,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-10T00:26:19.457052Z","submitted_at":"2025-02-26T02:57:59Z","title":"Reward Shaping to Mitigate Reward Hacking in RLHF"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 22 inbound Pith citation observations for arXiv:2502.18770."}