{"as_of":"2026-08-20T23:05:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:ec8b1407de517e5b2b73c492b7b9ad4b0829db11f130307216217d50bc267658","coverage":[{"denominator":35,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":35,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T15:49:07.633786Z","state":"measured"},{"denominator":39,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":39,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-20T06:33:59.587034+00:00","state":"measured"},{"denominator":4,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":4,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-01T08:01:22.596796Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"arxiv_reference","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":0,"observed_at":"2026-08-05T02:28:24.338817Z","source":"arxiv_reference"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2509.22047","last_updated":"2026-07-23T01:49:45Z","snapshot_observed_at":"2026-08-17T00:52:48.774529Z","submitted_at":"2025-09-26T08:32:22Z","title":"MO-GRPO: Mitigating Reward Hacking of Group Relative Policy Optimization on Multi-Objective Problems","version":3},"cited_work":{"arxiv_id":"2509.22047","doi":"10.48550/arxiv.2509.22047","metadata_source":"arxiv_reference","pith_arxiv_id":"2509.22047","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"MO-GRPO: Mitigating reward hacking of group relative policy optimization on multi-objective problems","venue":"arXiv (Cornell University)","work_id":"1490483b-6878-4e15-9bc3-8673448d53e7","year":2025},"citing_paper":{"arxiv_id":"2605.07276","last_updated":"2026-05-08T05:41:25Z","snapshot_observed_at":"2026-08-14T19:57:40.700811Z","submitted_at":"2026-05-08T05:41:25Z","title":"Signal Reshaping for GRPO in Weak-Feedback Agentic Code Repair","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-11T01:21:43.166304Z"},"links":{"cited_paper":"/paper/2509.22047","citing_paper":"/paper/2605.07276"},"observation_digest":"sha256:dd745fcb094ca7e46b409c534bc91c78793296ffd4fe2025b84a8fc5e8ebca31","observation_id":"48dbd911-a145-4704-a5fb-8372531e2bb0","resolution":{"observed_at":"2026-07-24T01:23:00.114209Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.22047","last_updated":"2026-07-23T01:49:45Z","snapshot_observed_at":"2026-08-17T00:52:48.774529Z","submitted_at":"2025-09-26T08:32:22Z","title":"MO-GRPO: Mitigating Reward Hacking of Group Relative Policy Optimization on Multi-Objective Problems","version":3},"cited_work":{"arxiv_id":"2509.22047","doi":"10.48550/arxiv.2509.22047","metadata_source":"arxiv_reference","pith_arxiv_id":"2509.22047","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"MO-GRPO: Mitigating reward hacking of group relative policy optimization on multi-objective problems","venue":"arXiv (Cornell University)","work_id":"1490483b-6878-4e15-9bc3-8673448d53e7","year":2025},"citing_paper":{"arxiv_id":"2605.24005","last_updated":"2026-05-30T07:28:43Z","snapshot_observed_at":"2026-08-16T20:52:52.505318Z","submitted_at":"2026-05-19T07:27:50Z","title":"LC-ERD: Mining Latent Logic for Self-Evolving Reasoning via Consistency-Regulated Reward Decomposition","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-06-30T18:44:14.878564Z"},"links":{"cited_paper":"/paper/2509.22047","citing_paper":"/paper/2605.24005"},"observation_digest":"sha256:0ca9832480e5dd1735e9830437b4416b41a4fe2f6cf3955533c12a4561aa7753","observation_id":"7406bf45-c10e-4699-a55d-e05fd9c9b6e3","resolution":{"observed_at":"2026-07-24T01:23:00.114209Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.22047","last_updated":"2026-07-23T01:49:45Z","snapshot_observed_at":"2026-08-17T00:52:48.774529Z","submitted_at":"2025-09-26T08:32:22Z","title":"MO-GRPO: Mitigating Reward Hacking of Group Relative Policy Optimization on Multi-Objective Problems","version":3},"cited_work":{"arxiv_id":"2509.22047","doi":"10.48550/arxiv.2509.22047","metadata_source":"arxiv_reference","pith_arxiv_id":"2509.22047","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"MO-GRPO: Mitigating reward hacking of group relative policy optimization on multi-objective problems","venue":"arXiv (Cornell University)","work_id":"1490483b-6878-4e15-9bc3-8673448d53e7","year":2025},"citing_paper":{"arxiv_id":"2606.21413","last_updated":"2026-06-19T13:28:59Z","snapshot_observed_at":"2026-08-13T02:02:06.940221Z","submitted_at":"2026-06-19T13:28:59Z","title":"CAT-Translate: Building Compact Open-Source Models for Japanese-English Translation","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-06-26T14:26:38.264174Z"},"links":{"cited_paper":"/paper/2509.22047","citing_paper":"/paper/2606.21413"},"observation_digest":"sha256:4a6d71a35998e8e11b34626f74e207e04a4dfa0634055dba7e09aa27f2757250","observation_id":"6a1c1148-0f65-4735-b945-e1745b9a9113","resolution":{"observed_at":"2026-07-24T01:23:00.114209Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.22047","last_updated":"2026-07-23T01:49:45Z","snapshot_observed_at":"2026-08-17T00:52:48.774529Z","submitted_at":"2025-09-26T08:32:22Z","title":"MO-GRPO: Mitigating Reward Hacking of Group Relative Policy Optimization on Multi-Objective Problems","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.22047","snapshot_observed_at":"2026-08-01T08:01:22.596796Z","title":"MO-GRPO: Mitigating reward hacking of group relative policy optimization on multi-objective problems.arXiv preprint arXiv:2509.22047,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.21273","last_updated":"2026-08-04T10:37:25Z","snapshot_observed_at":"2026-08-07T23:11:42.684740Z","submitted_at":"2026-07-23T12:50:18Z","title":"The Dark Room in the Reward Channel: Dense Prediction Rewards Collapse GRPO-Trained LLM Agents -- and The Channel, Not the Content, Decides What Works","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-01T08:01:22.596796Z"},"links":{"cited_paper":"/paper/2509.22047","citing_paper":"/paper/2607.21273"},"observation_digest":"sha256:c4a51272920956c4a2f3f48f847820298f7bfc22195fca174377d2b6065dad13","observation_id":"5e56dbc7-b428-44ad-acbf-d3500a46a56b","resolution":{"observed_at":"2026-08-01T08:01:22.596796Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2509.22047/citation-record","integrity":"/paper/2509.22047/integrity","json":"/paper/2509.22047/citation-record.json","paper":"/paper/2509.22047"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:49:07.483220Z","title":"URL: \" 'urlintro :=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.22047","last_updated":"2026-07-23T01:49:45Z","snapshot_observed_at":"2026-08-17T00:52:48.774529Z","submitted_at":"2025-09-26T08:32:22Z","title":"MO-GRPO: Mitigating Reward Hacking of Group Relative Policy Optimization on Multi-Objective Problems","version":3},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-15T15:49:07.483220Z"},"links":{"citing_paper":"/paper/2509.22047"},"observation_digest":"sha256:0302a6b70e0f3aa335b109042c3197674ff761a00be7f8bcefce67962b92bdb7","observation_id":"a3726d08-fc94-415a-b2fb-927bf1841e39","resolution":{"observed_at":"2026-08-15T15:49:07.483220Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:49:07.488719Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.22047","last_updated":"2026-07-23T01:49:45Z","snapshot_observed_at":"2026-08-17T00:52:48.774529Z","submitted_at":"2025-09-26T08:32:22Z","title":"MO-GRPO: Mitigating Reward Hacking of Group Relative Policy Optimization on Multi-Objective Problems","version":3},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-15T15:49:07.488719Z"},"links":{"citing_paper":"/paper/2509.22047"},"observation_digest":"sha256:44bb1556eb0fc8a5e9cca1336f1cf47a35800b6d3b63d1c0dabf2741fc071e3a","observation_id":"66e50fcd-521d-457e-9ccd-3ec88077a324","resolution":{"observed_at":"2026-08-15T15:49:07.488719Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:49:07.493350Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.22047","last_updated":"2026-07-23T01:49:45Z","snapshot_observed_at":"2026-08-17T00:52:48.774529Z","submitted_at":"2025-09-26T08:32:22Z","title":"MO-GRPO: Mitigating Reward Hacking of Group Relative Policy Optimization on Multi-Objective Problems","version":3},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-15T15:49:07.493350Z"},"links":{"citing_paper":"/paper/2509.22047"},"observation_digest":"sha256:2a2492c0dc1a550acdb6fb846081f3f360031988e1b0142cc962ad20b97b8240","observation_id":"9a190610-c58f-4f4b-88be-babca967dd9d","resolution":{"observed_at":"2026-08-15T15:49:07.493350Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1606.06565","last_updated":"2016-07-25T17:23:29Z","snapshot_observed_at":"2026-07-06T05:00:46.434335Z","submitted_at":"2016-06-21T13:37:05Z","title":"Concrete Problems in AI Safety","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1606.06565","snapshot_observed_at":"2026-08-15T15:49:07.499209Z","title":null,"venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2509.22047","last_updated":"2026-07-23T01:49:45Z","snapshot_observed_at":"2026-08-17T00:52:48.774529Z","submitted_at":"2025-09-26T08:32:22Z","title":"MO-GRPO: Mitigating Reward Hacking of Group Relative Policy Optimization on Multi-Objective Problems","version":3},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-15T15:49:07.499209Z"},"links":{"cited_paper":"/paper/1606.06565","citing_paper":"/paper/2509.22047"},"observation_digest":"sha256:0c8ac27a6b7d2e3b72529a018fff0a9551d9ceb17adfb369e8afddc55b64f4a9","observation_id":"48324b8d-8d99-46a1-ad87-f61a763f4819","resolution":{"observed_at":"2026-08-15T15:49:07.499209Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:49:08.050283Z","title":null,"venue":null,"work_id":"b2d2bcf7-e1d0-4e52-a783-32429972ecd4","year":2023},"citing_paper":{"arxiv_id":"2509.22047","last_updated":"2026-07-23T01:49:45Z","snapshot_observed_at":"2026-08-17T00:52:48.774529Z","submitted_at":"2025-09-26T08:32:22Z","title":"MO-GRPO: Mitigating Reward Hacking of Group Relative Policy Optimization on Multi-Objective Problems","version":3},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-15T15:49:07.503886Z"},"links":{"citing_paper":"/paper/2509.22047"},"observation_digest":"sha256:540dd9812fb314f701ef80236726a7c10788d8c1c0ce35324152f6aab3bb7874","observation_id":"cc09a5fc-0f1d-4b49-a885-e643a163392e","resolution":{"observed_at":"2026-08-15T15:49:08.054890Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:49:08.035318Z","title":null,"venue":null,"work_id":"ee404b0b-335d-4c16-8e20-086c252ed172","year":2023},"citing_paper":{"arxiv_id":"2509.22047","last_updated":"2026-07-23T01:49:45Z","snapshot_observed_at":"2026-08-17T00:52:48.774529Z","submitted_at":"2025-09-26T08:32:22Z","title":"MO-GRPO: Mitigating Reward Hacking of Group Relative Policy Optimization on Multi-Objective Problems","version":3},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-15T15:49:07.508835Z"},"links":{"citing_paper":"/paper/2509.22047"},"observation_digest":"sha256:d8864cb4a9c713436b739deb6341db6126329a8f7f41501e90592de977486276","observation_id":"760ba96c-ecea-41e6-a84b-43d6098f94d1","resolution":{"observed_at":"2026-08-15T15:49:08.040279Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:49:08.018171Z","title":"Alegre, Ann Nowe, Ana Bazzan, El Ghazali Talbi, Gr\\' e goire Danoy, and Bruno C","venue":null,"work_id":"140d6f9b-8fb5-4805-935f-418e01164026","year":2023},"citing_paper":{"arxiv_id":"2509.22047","last_updated":"2026-07-23T01:49:45Z","snapshot_observed_at":"2026-08-17T00:52:48.774529Z","submitted_at":"2025-09-26T08:32:22Z","title":"MO-GRPO: Mitigating Reward Hacking of Group Relative Policy Optimization on Multi-Objective Problems","version":3},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-15T15:49:07.513194Z"},"links":{"citing_paper":"/paper/2509.22047"},"observation_digest":"sha256:88de75a8de4498b306730a1171a7f12cc1df30efe331c5a83bf41298d33f076d","observation_id":"4c476ffd-6f71-47da-9b68-d7ec0b870b1e","resolution":{"observed_at":"2026-08-15T15:49:08.023659Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:49:08.002901Z","title":null,"venue":null,"work_id":"278328e5-bfec-48f9-a80c-daa80f364ea3","year":2025},"citing_paper":{"arxiv_id":"2509.22047","last_updated":"2026-07-23T01:49:45Z","snapshot_observed_at":"2026-08-17T00:52:48.774529Z","submitted_at":"2025-09-26T08:32:22Z","title":"MO-GRPO: Mitigating Reward Hacking of Group Relative Policy Optimization on Multi-Objective Problems","version":3},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-15T15:49:07.517788Z"},"links":{"citing_paper":"/paper/2509.22047"},"observation_digest":"sha256:118ce3d36abf2f9f308c4e5c65f0bab9ba72f2db521dda13fd99a67d1fb22b57","observation_id":"c99a6e90-0a57-4def-a4a1-a03e316fb8e0","resolution":{"observed_at":"2026-08-15T15:49:08.007318Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:49:07.521973Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.22047","last_updated":"2026-07-23T01:49:45Z","snapshot_observed_at":"2026-08-17T00:52:48.774529Z","submitted_at":"2025-09-26T08:32:22Z","title":"MO-GRPO: Mitigating Reward Hacking of Group Relative Policy Optimization on Multi-Objective Problems","version":3},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-15T15:49:07.521973Z"},"links":{"citing_paper":"/paper/2509.22047"},"observation_digest":"sha256:628cf57f8bb7e43a432f4c4ac4ff55c40d2e63069d155b0d44abdcfc7e1c06a5","observation_id":"da0ff5f9-e48f-4e8f-8f72-50680748e675","resolution":{"observed_at":"2026-08-15T15:49:07.521973Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:49:07.527109Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.22047","last_updated":"2026-07-23T01:49:45Z","snapshot_observed_at":"2026-08-17T00:52:48.774529Z","submitted_at":"2025-09-26T08:32:22Z","title":"MO-GRPO: Mitigating Reward Hacking of Group Relative Policy Optimization on Multi-Objective Problems","version":3},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-15T15:49:07.527109Z"},"links":{"citing_paper":"/paper/2509.22047"},"observation_digest":"sha256:326136863795d2f8eaab50bbab4928b1762133a4da5a3e02a961579807c50809","observation_id":"4129b698-f09a-4d28-8c40-669c6998dace","resolution":{"observed_at":"2026-08-15T15:49:07.527109Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:49:07.980187Z","title":null,"venue":null,"work_id":"97cc6ccf-c815-4e28-8347-1f6fda2adf89","year":2023},"citing_paper":{"arxiv_id":"2509.22047","last_updated":"2026-07-23T01:49:45Z","snapshot_observed_at":"2026-08-17T00:52:48.774529Z","submitted_at":"2025-09-26T08:32:22Z","title":"MO-GRPO: Mitigating Reward Hacking of Group Relative Policy Optimization on Multi-Objective Problems","version":3},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-15T15:49:07.531530Z"},"links":{"citing_paper":"/paper/2509.22047"},"observation_digest":"sha256:8a5df908e61d4dc8c9a90639aa1d5c2093c0b512a05bc05f856792d50699a0fa","observation_id":"a123be4e-6328-4b17-89c9-46ee84a7d3a8","resolution":{"observed_at":"2026-08-15T15:49:07.984262Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:49:07.968029Z","title":null,"venue":null,"work_id":"ed7841d8-f692-49b9-a02b-9fa62ba99cea","year":2020},"citing_paper":{"arxiv_id":"2509.22047","last_updated":"2026-07-23T01:49:45Z","snapshot_observed_at":"2026-08-17T00:52:48.774529Z","submitted_at":"2025-09-26T08:32:22Z","title":"MO-GRPO: Mitigating Reward Hacking of Group Relative Policy Optimization on Multi-Objective Problems","version":3},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-15T15:49:07.536619Z"},"links":{"citing_paper":"/paper/2509.22047"},"observation_digest":"sha256:83dc3132eb72931e5121127d78e6b51eca4534a668a650536223f409ed8124e6","observation_id":"0cdecf5c-ab15-49e9-90d5-0e3b2c68a704","resolution":{"observed_at":"2026-08-15T15:49:07.972283Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-13T17:20:44.002518Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-15T15:49:07.541356Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.22047","last_updated":"2026-07-23T01:49:45Z","snapshot_observed_at":"2026-08-17T00:52:48.774529Z","submitted_at":"2025-09-26T08:32:22Z","title":"MO-GRPO: Mitigating Reward Hacking of Group Relative Policy Optimization on Multi-Objective Problems","version":3},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-15T15:49:07.541356Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2509.22047"},"observation_digest":"sha256:5a801b65bc095ab669473fc38fd6b501b3b4c9bddec6f1a6438f8f626ca3760d","observation_id":"7cb53439-b37c-46ac-a318-7ddb1aed75c9","resolution":{"observed_at":"2026-08-15T15:49:07.541356Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:49:07.954588Z","title":null,"venue":null,"work_id":"801117c0-e6e2-4fc4-82b1-77ffe5fa7e9b","year":2015},"citing_paper":{"arxiv_id":"2509.22047","last_updated":"2026-07-23T01:49:45Z","snapshot_observed_at":"2026-08-17T00:52:48.774529Z","submitted_at":"2025-09-26T08:32:22Z","title":"MO-GRPO: Mitigating Reward Hacking of Group Relative Policy Optimization on Multi-Objective Problems","version":3},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-15T15:49:07.545720Z"},"links":{"citing_paper":"/paper/2509.22047"},"observation_digest":"sha256:b54156b8791c1accea761ec8be56d013e65d96e9c44940fe47e0f5d01652a8a6","observation_id":"ee9dc9f2-ed03-451f-b8e3-6b8b7c43b9b7","resolution":{"observed_at":"2026-08-15T15:49:07.958926Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:49:07.941308Z","title":null,"venue":null,"work_id":"63b0d594-7a84-4071-9067-5a51431de77f","year":2025},"citing_paper":{"arxiv_id":"2509.22047","last_updated":"2026-07-23T01:49:45Z","snapshot_observed_at":"2026-08-17T00:52:48.774529Z","submitted_at":"2025-09-26T08:32:22Z","title":"MO-GRPO: Mitigating Reward Hacking of Group Relative Policy Optimization on Multi-Objective Problems","version":3},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-15T15:49:07.550638Z"},"links":{"citing_paper":"/paper/2509.22047"},"observation_digest":"sha256:07439fe82e7484cc5644d20d6cf8b1fae72855c882ed9ffb035ae0f47343580e","observation_id":"e810e80a-1e2c-41ed-9040-29ecc7dfa711","resolution":{"observed_at":"2026-08-15T15:49:07.945528Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:49:07.554403Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.22047","last_updated":"2026-07-23T01:49:45Z","snapshot_observed_at":"2026-08-17T00:52:48.774529Z","submitted_at":"2025-09-26T08:32:22Z","title":"MO-GRPO: Mitigating Reward Hacking of Group Relative Policy Optimization on Multi-Objective Problems","version":3},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-15T15:49:07.554403Z"},"links":{"citing_paper":"/paper/2509.22047"},"observation_digest":"sha256:71a83f9c60a371e10657b6c8319b66383bb48d032c4f61cba0177c970bd62419","observation_id":"3cde26d9-8acb-466c-b53a-8b8d9b873093","resolution":{"observed_at":"2026-08-15T15:49:07.554403Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:49:07.928624Z","title":null,"venue":null,"work_id":"168d943e-9bb1-47be-8ae8-f32060b0e9bc","year":2025},"citing_paper":{"arxiv_id":"2509.22047","last_updated":"2026-07-23T01:49:45Z","snapshot_observed_at":"2026-08-17T00:52:48.774529Z","submitted_at":"2025-09-26T08:32:22Z","title":"MO-GRPO: Mitigating Reward Hacking of Group Relative Policy Optimization on Multi-Objective Problems","version":3},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-15T15:49:07.558156Z"},"links":{"citing_paper":"/paper/2509.22047"},"observation_digest":"sha256:f416ca4a0322708eca0768f36d9fe6d3a499c880701aae44c6cfc422592b4800","observation_id":"e021a919-49f1-4e17-a82c-b6afdea50566","resolution":{"observed_at":"2026-08-15T15:49:07.932670Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.19437","last_updated":"2025-02-18T17:26:38Z","snapshot_observed_at":"2026-08-18T18:18:37.449517Z","submitted_at":"2024-12-27T04:03:16Z","title":"DeepSeek-V3 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.19437","snapshot_observed_at":"2026-08-15T15:49:07.562204Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.22047","last_updated":"2026-07-23T01:49:45Z","snapshot_observed_at":"2026-08-17T00:52:48.774529Z","submitted_at":"2025-09-26T08:32:22Z","title":"MO-GRPO: Mitigating Reward Hacking of Group Relative Policy Optimization on Multi-Objective Problems","version":3},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-15T15:49:07.562204Z"},"links":{"cited_paper":"/paper/2412.19437","citing_paper":"/paper/2509.22047"},"observation_digest":"sha256:2c602ee093091dd2fe680f5094083cf47e9fbbc269113c4eafcfd7d112e61a3c","observation_id":"d8f6086f-edbb-444a-ad56-e6c81bfe27ab","resolution":{"observed_at":"2026-08-15T15:49:07.562204Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20783","last_updated":"2025-10-06T09:30:03Z","snapshot_observed_at":"2026-08-13T12:34:54.476684Z","submitted_at":"2025-03-26T17:59:14Z","title":"Understanding R1-Zero-Like Training: A Critical Perspective","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.20783","snapshot_observed_at":"2026-08-15T15:49:07.566529Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.22047","last_updated":"2026-07-23T01:49:45Z","snapshot_observed_at":"2026-08-17T00:52:48.774529Z","submitted_at":"2025-09-26T08:32:22Z","title":"MO-GRPO: Mitigating Reward Hacking of Group Relative Policy Optimization on Multi-Objective Problems","version":3},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-15T15:49:07.566529Z"},"links":{"cited_paper":"/paper/2503.20783","citing_paper":"/paper/2509.22047"},"observation_digest":"sha256:2e940a87afccce9d9ee667b93d822ea9c84a72d506c46d204c4e928446e6e28a","observation_id":"d896acf7-ec33-4129-aec3-2e9a403b4625","resolution":{"observed_at":"2026-08-15T15:49:07.566529Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:49:07.916117Z","title":null,"venue":null,"work_id":"aa14d69c-86f1-4f8d-9cf7-5aefba62f3b3","year":2022},"citing_paper":{"arxiv_id":"2509.22047","last_updated":"2026-07-23T01:49:45Z","snapshot_observed_at":"2026-08-17T00:52:48.774529Z","submitted_at":"2025-09-26T08:32:22Z","title":"MO-GRPO: Mitigating Reward Hacking of Group Relative Policy Optimization on Multi-Objective Problems","version":3},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-15T15:49:07.572304Z"},"links":{"citing_paper":"/paper/2509.22047"},"observation_digest":"sha256:abec6b33f71cc7b50d27e2269eade683695bca6425510d057eb374509f7e4492","observation_id":"20c222c6-1e6b-4426-a944-ae9d3b266aa9","resolution":{"observed_at":"2026-08-15T15:49:07.920052Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:49:07.899275Z","title":"Bradley Knox, Chelsea Finn, and Scott Niekum","venue":null,"work_id":"35386035-cc4f-4efb-9df5-929ed9bc3844","year":2024},"citing_paper":{"arxiv_id":"2509.22047","last_updated":"2026-07-23T01:49:45Z","snapshot_observed_at":"2026-08-17T00:52:48.774529Z","submitted_at":"2025-09-26T08:32:22Z","title":"MO-GRPO: Mitigating Reward Hacking of Group Relative Policy Optimization on Multi-Objective Problems","version":3},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-15T15:49:07.576241Z"},"links":{"citing_paper":"/paper/2509.22047"},"observation_digest":"sha256:9bc8bf38105b9481d094d6895c1fbd1601076a16e35503cdff5cdc77972b9d35","observation_id":"e23f06e1-02aa-418a-9697-73c43e8af065","resolution":{"observed_at":"2026-08-15T15:49:07.905287Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.10910","last_updated":"2025-06-12T17:22:37Z","snapshot_observed_at":"2026-08-08T22:49:29.831091Z","submitted_at":"2025-06-12T17:22:37Z","title":"Magistral","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.10910","snapshot_observed_at":"2026-08-15T15:49:07.580795Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.22047","last_updated":"2026-07-23T01:49:45Z","snapshot_observed_at":"2026-08-17T00:52:48.774529Z","submitted_at":"2025-09-26T08:32:22Z","title":"MO-GRPO: Mitigating Reward Hacking of Group Relative Policy Optimization on Multi-Objective Problems","version":3},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-15T15:49:07.580795Z"},"links":{"cited_paper":"/paper/2506.10910","citing_paper":"/paper/2509.22047"},"observation_digest":"sha256:9927ba718b090c47cad6c81feadfd46af6250cc517a4967134392e2f40736252","observation_id":"eb683d59-e733-45c2-b54a-fd10b31088b4","resolution":{"observed_at":"2026-08-15T15:49:07.580795Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:49:07.584960Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2509.22047","last_updated":"2026-07-23T01:49:45Z","snapshot_observed_at":"2026-08-17T00:52:48.774529Z","submitted_at":"2025-09-26T08:32:22Z","title":"MO-GRPO: Mitigating Reward Hacking of Group Relative Policy Optimization on Multi-Objective Problems","version":3},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-15T15:49:07.584960Z"},"links":{"citing_paper":"/paper/2509.22047"},"observation_digest":"sha256:c96f5142256b78343498f68d4a94af8b351ff2d56146a8c0e2302abafcbf6813","observation_id":"514b1e38-43e0-4bd5-a606-2a4150296a47","resolution":{"observed_at":"2026-08-15T15:49:07.584960Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-15T15:49:07.589161Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.22047","last_updated":"2026-07-23T01:49:45Z","snapshot_observed_at":"2026-08-17T00:52:48.774529Z","submitted_at":"2025-09-26T08:32:22Z","title":"MO-GRPO: Mitigating Reward Hacking of Group Relative Policy Optimization on Multi-Objective Problems","version":3},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-15T15:49:07.589161Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2509.22047"},"observation_digest":"sha256:8d8f414124578ac6b1095c5221565be51cfc33505834e860d58b530436588e66","observation_id":"1a6ce09f-1bb0-455f-a487-bf80d7821883","resolution":{"observed_at":"2026-08-15T15:49:07.589161Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:49:07.882332Z","title":null,"venue":null,"work_id":"942ec610-027d-41ae-a5d7-cf09a5d11a7d","year":2023},"citing_paper":{"arxiv_id":"2509.22047","last_updated":"2026-07-23T01:49:45Z","snapshot_observed_at":"2026-08-17T00:52:48.774529Z","submitted_at":"2025-09-26T08:32:22Z","title":"MO-GRPO: Mitigating Reward Hacking of Group Relative Policy Optimization on Multi-Objective Problems","version":3},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-15T15:49:07.593278Z"},"links":{"citing_paper":"/paper/2509.22047"},"observation_digest":"sha256:96f6ed06fc3168a02108a4187e7b33cbc8dc6d0708f492842b93d70de5ad4a38","observation_id":"6771ef64-3ba7-43f3-b4e3-647754b8e4b1","resolution":{"observed_at":"2026-08-15T15:49:07.887315Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:49:07.868237Z","title":null,"venue":null,"work_id":"94f988ab-36d5-4c1f-be8f-53b2a636ad99","year":2024},"citing_paper":{"arxiv_id":"2509.22047","last_updated":"2026-07-23T01:49:45Z","snapshot_observed_at":"2026-08-17T00:52:48.774529Z","submitted_at":"2025-09-26T08:32:22Z","title":"MO-GRPO: Mitigating Reward Hacking of Group Relative Policy Optimization on Multi-Objective Problems","version":3},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-15T15:49:07.596945Z"},"links":{"citing_paper":"/paper/2509.22047"},"observation_digest":"sha256:9bac14008feaee4d69d201fc408837c49de6d2bd12a2a554ed5e8aa88372ed94","observation_id":"14c1781f-c34e-4d4d-ae53-b8619391bfc8","resolution":{"observed_at":"2026-08-15T15:49:07.872941Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:49:07.853806Z","title":null,"venue":null,"work_id":"2c9df858-712e-46d6-9071-32fa8c019a5a","year":2022},"citing_paper":{"arxiv_id":"2509.22047","last_updated":"2026-07-23T01:49:45Z","snapshot_observed_at":"2026-08-17T00:52:48.774529Z","submitted_at":"2025-09-26T08:32:22Z","title":"MO-GRPO: Mitigating Reward Hacking of Group Relative Policy Optimization on Multi-Objective Problems","version":3},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-15T15:49:07.600648Z"},"links":{"citing_paper":"/paper/2509.22047"},"observation_digest":"sha256:3c4ad994a2db5fcd70bec880f7befdf48612d9622c91fb73a08dc2e0b92c15e9","observation_id":"9d1b11e7-5133-4d5a-b163-084082d8ac14","resolution":{"observed_at":"2026-08-15T15:49:07.858387Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:49:07.605435Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2509.22047","last_updated":"2026-07-23T01:49:45Z","snapshot_observed_at":"2026-08-17T00:52:48.774529Z","submitted_at":"2025-09-26T08:32:22Z","title":"MO-GRPO: Mitigating Reward Hacking of Group Relative Policy Optimization on Multi-Objective Problems","version":3},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-15T15:49:07.605435Z"},"links":{"citing_paper":"/paper/2509.22047"},"observation_digest":"sha256:276f16ed69c80fa78f87377ca403217b3ff89469f9a528564f28a324ccb333b3","observation_id":"6d7cbe3a-90be-465c-9e47-0fa424104b69","resolution":{"observed_at":"2026-08-15T15:49:07.605435Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:49:07.609159Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.22047","last_updated":"2026-07-23T01:49:45Z","snapshot_observed_at":"2026-08-17T00:52:48.774529Z","submitted_at":"2025-09-26T08:32:22Z","title":"MO-GRPO: Mitigating Reward Hacking of Group Relative Policy Optimization on Multi-Objective Problems","version":3},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-15T15:49:07.609159Z"},"links":{"citing_paper":"/paper/2509.22047"},"observation_digest":"sha256:0a83e3c747077450e171428ad63f29a28ecc8708e91cd3012e22638d04abff78","observation_id":"968d5be7-7c4c-4c75-bfca-aba6ac703d52","resolution":{"observed_at":"2026-08-15T15:49:07.609159Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.02864","last_updated":"2025-06-03T13:28:57Z","snapshot_observed_at":"2026-08-10T01:49:57.636880Z","submitted_at":"2025-06-03T13:28:57Z","title":"BNPO: Beta Normalization Policy Optimization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.02864","snapshot_observed_at":"2026-08-15T15:49:07.612952Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.22047","last_updated":"2026-07-23T01:49:45Z","snapshot_observed_at":"2026-08-17T00:52:48.774529Z","submitted_at":"2025-09-26T08:32:22Z","title":"MO-GRPO: Mitigating Reward Hacking of Group Relative Policy Optimization on Multi-Objective Problems","version":3},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-15T15:49:07.612952Z"},"links":{"cited_paper":"/paper/2506.02864","citing_paper":"/paper/2509.22047"},"observation_digest":"sha256:7fd43041ebe5b20f9668ae9c343a54951e982ef75eaa9b2fcf1e16a530735e0f","observation_id":"be2d50b4-5f92-4b7b-9444-e13a3ae5bbe5","resolution":{"observed_at":"2026-08-15T15:49:07.612952Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-08-15T15:49:07.616957Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.22047","last_updated":"2026-07-23T01:49:45Z","snapshot_observed_at":"2026-08-17T00:52:48.774529Z","submitted_at":"2025-09-26T08:32:22Z","title":"MO-GRPO: Mitigating Reward Hacking of Group Relative Policy Optimization on Multi-Objective Problems","version":3},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-15T15:49:07.616957Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2509.22047"},"observation_digest":"sha256:b724ea58abe82fc023189ed7b5ba80a403acfafd0ec9089395625cbb46d7b443","observation_id":"bd5654c1-11e8-495d-aa80-613796a2a4f0","resolution":{"observed_at":"2026-08-15T15:49:07.616957Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.18071","last_updated":"2025-07-28T11:11:33Z","snapshot_observed_at":"2026-08-15T00:49:38.146652Z","submitted_at":"2025-07-24T03:50:32Z","title":"Group Sequence Policy Optimization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.18071","snapshot_observed_at":"2026-08-15T15:49:07.621278Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.22047","last_updated":"2026-07-23T01:49:45Z","snapshot_observed_at":"2026-08-17T00:52:48.774529Z","submitted_at":"2025-09-26T08:32:22Z","title":"MO-GRPO: Mitigating Reward Hacking of Group Relative Policy Optimization on Multi-Objective Problems","version":3},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-15T15:49:07.621278Z"},"links":{"cited_paper":"/paper/2507.18071","citing_paper":"/paper/2509.22047"},"observation_digest":"sha256:b6b62097e160df718f7f6b591594ba0508800646dd1ba51000dd920077f45b8b","observation_id":"d1c491fc-cc26-41cc-820f-ab52ce302f17","resolution":{"observed_at":"2026-08-15T15:49:07.621278Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:49:07.831410Z","title":null,"venue":null,"work_id":"3000640f-dbed-4955-8b7a-a031086910fd","year":2023},"citing_paper":{"arxiv_id":"2509.22047","last_updated":"2026-07-23T01:49:45Z","snapshot_observed_at":"2026-08-17T00:52:48.774529Z","submitted_at":"2025-09-26T08:32:22Z","title":"MO-GRPO: Mitigating Reward Hacking of Group Relative Policy Optimization on Multi-Objective Problems","version":3},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-15T15:49:07.625503Z"},"links":{"citing_paper":"/paper/2509.22047"},"observation_digest":"sha256:b24a13e6b1287dd392d3e832b370b48c24241364b18c129bdf9e0ca92edfe7ef","observation_id":"a1e784c5-8604-4ff7-aa4a-d9fa2cb420a2","resolution":{"observed_at":"2026-08-15T15:49:07.836779Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:49:07.629420Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.22047","last_updated":"2026-07-23T01:49:45Z","snapshot_observed_at":"2026-08-17T00:52:48.774529Z","submitted_at":"2025-09-26T08:32:22Z","title":"MO-GRPO: Mitigating Reward Hacking of Group Relative Policy Optimization on Multi-Objective Problems","version":3},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-15T15:49:07.629420Z"},"links":{"citing_paper":"/paper/2509.22047"},"observation_digest":"sha256:215a9a681478cf4c7eaf23c18e42e011a380523102bbf771ad8bea90f64d84a8","observation_id":"ec15d00e-3a95-4f00-8c22-c978c59cd61b","resolution":{"observed_at":"2026-08-15T15:49:07.629420Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1909.08593","last_updated":"2020-01-08T23:02:36Z","snapshot_observed_at":"2026-08-16T00:15:57.597094Z","submitted_at":"2019-09-18T17:33:39Z","title":"Fine-Tuning Language Models from Human Preferences","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1909.08593","snapshot_observed_at":"2026-08-15T15:49:07.633786Z","title":"Ziegler, Nisan Stiennon, Jeffrey Wu, Tom B","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2509.22047","last_updated":"2026-07-23T01:49:45Z","snapshot_observed_at":"2026-08-17T00:52:48.774529Z","submitted_at":"2025-09-26T08:32:22Z","title":"MO-GRPO: Mitigating Reward Hacking of Group Relative Policy Optimization on Multi-Objective Problems","version":3},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-15T15:49:07.633786Z"},"links":{"cited_paper":"/paper/1909.08593","citing_paper":"/paper/2509.22047"},"observation_digest":"sha256:225ce27526041e9a47fa90152aa0c422728c0e855485f19ce6f2fbae5fbdb8a0","observation_id":"adc5925d-4d6f-4cfe-acad-35db3d87ebff","resolution":{"observed_at":"2026-08-15T15:49:07.633786Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2509.22047","last_updated":"2026-07-23T01:49:45Z","latest_version":3,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-17T00:52:48.774529Z","submitted_at":"2025-09-26T08:32:22Z","title":"MO-GRPO: Mitigating Reward Hacking of Group Relative Policy Optimization on Multi-Objective Problems"},"reference_resolution":{"displayed":35,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":33,"verified_exact":0,"verified_fuzzy":2},"total_outbound_references":35},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"thesis":"As of 20 August 2026, this Paper Citation Record lists 35 of 35 outbound references and 4 inbound Pith citation observations for arXiv:2509.22047."}