{"as_of":"2026-08-05T09:53:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:02fed6059727213bb4ea96f1a27f80a17c0f0a85fb38512e418f584c7eccd660","coverage":[{"denominator":29,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":29,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-10T14:53:35.133157Z","state":"measured"},{"denominator":30,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":30,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-05T06:32:48.257954+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-13T02:39:02.891861Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2605.04077","last_updated":"2026-04-14T09:48:46Z","snapshot_observed_at":"2026-08-03T18:20:15.646381Z","submitted_at":"2026-04-14T09:48:46Z","title":"Balanced Aggregation: Understanding and Fixing Aggregation Bias in GRPO","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.04077","snapshot_observed_at":"2026-07-13T02:39:02.891861Z","title":"Balanced aggregation: Understanding and fixing aggregation bias in grpo.arXiv preprint arXiv:2605.04077, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.09492","last_updated":"2026-07-10T15:06:48Z","snapshot_observed_at":"2026-08-02T02:14:15.956064Z","submitted_at":"2026-07-10T15:06:48Z","title":"Multimodal Reward Hacking in Reinforcement Learning","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-07-13T02:39:02.891861Z"},"links":{"cited_paper":"/paper/2605.04077","citing_paper":"/paper/2607.09492"},"observation_digest":"sha256:5572dfc9135e8aff8fe7bbb53371923437cdb9dda6bef22db9c77dee862923aa","observation_id":"419567d6-c8b2-4ee9-907b-633a9b827c4d","resolution":{"observed_at":"2026-07-13T02:39:02.891861Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2605.04077/citation-record","integrity":"/paper/2605.04077/integrity","json":"/paper/2605.04077/citation-record.json","paper":"/paper/2605.04077"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2512.02556","last_updated":"2025-12-02T09:25:14Z","snapshot_observed_at":"2026-07-31T23:49:25.878472Z","submitted_at":"2025-12-02T09:25:14Z","title":"DeepSeek-V3.2: Pushing the Frontier of Open Large Language Models","version":1},"cited_work":{"arxiv_id":"2512.02556","doi":"10.18653/v1/d18-1512","metadata_source":"pith","pith_arxiv_id":"2512.02556","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DeepSeek-V3.2: Pushing the Frontier of Open Large Language Models","venue":"cs.CL","work_id":"07c85cc5-4086-4abc-823b-6d0f4ff784d0","year":2025},"citing_paper":{"arxiv_id":"2605.04077","last_updated":"2026-04-14T09:48:46Z","snapshot_observed_at":"2026-08-03T18:20:15.646381Z","submitted_at":"2026-04-14T09:48:46Z","title":"Balanced Aggregation: Understanding and Fixing Aggregation Bias in GRPO","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-10T14:53:35.133157Z"},"links":{"cited_paper":"/paper/2512.02556","citing_paper":"/paper/2605.04077"},"observation_digest":"sha256:afdafe07ecbe476375971cdac40f5712ad727437ebf8590a16e252ee21b6fa98","observation_id":"211aca48-d816-4b43-b352-a918446314ba","resolution":{"observed_at":"2026-05-11T11:26:04.692861Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Polaris: A post-training recipe for scaling reinforcement learning on advanced reasoning models","venue":null,"work_id":"4f0de988-dc54-4a58-a1da-f17401670346","year":2025},"citing_paper":{"arxiv_id":"2605.04077","last_updated":"2026-04-14T09:48:46Z","snapshot_observed_at":"2026-08-03T18:20:15.646381Z","submitted_at":"2026-04-14T09:48:46Z","title":"Balanced Aggregation: Understanding and Fixing Aggregation Bias in GRPO","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-10T14:53:35.133157Z"},"links":{"citing_paper":"/paper/2605.04077"},"observation_digest":"sha256:6f85db400656722ffc0ef0d63523d7b64bd13bce8e11b3aaa22ec9bd57f3b2ba","observation_id":"4bd1f855-baca-4e31-bcde-2229ff47f0b5","resolution":{"observed_at":"2026-05-18T11:21:20.349344Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1038/s41586-025-09422-z","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T03:06:43.562716Z","title":"doi: 10.1038/s41586-025-09422-z","venue":"Nature","work_id":"9835b482-5032-4135-93dd-82a066677569","year":2025},"citing_paper":{"arxiv_id":"2605.04077","last_updated":"2026-04-14T09:48:46Z","snapshot_observed_at":"2026-08-03T18:20:15.646381Z","submitted_at":"2026-04-14T09:48:46Z","title":"Balanced Aggregation: Understanding and Fixing Aggregation Bias in GRPO","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-10T14:53:35.133157Z"},"links":{"citing_paper":"/paper/2605.04077"},"observation_digest":"sha256:032a00177b8a52624b8e578b122bef6686c1cbc4cb60e0431b6bdeddde80f87a","observation_id":"71b97418-39dd-4d49-9561-98ae38de3798","resolution":{"observed_at":"2026-05-10T14:55:31.456353Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-03T22:08:21.094896+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-03T22:08:21.094896+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Olympiadbench: A challenging benchmark for promoting agi with olympiad-level bilingual multimodal scientific problems","venue":null,"work_id":"17e489a3-d047-4be0-82e6-33efcfcf21e9","year":2024},"citing_paper":{"arxiv_id":"2605.04077","last_updated":"2026-04-14T09:48:46Z","snapshot_observed_at":"2026-08-03T18:20:15.646381Z","submitted_at":"2026-04-14T09:48:46Z","title":"Balanced Aggregation: Understanding and Fixing Aggregation Bias in GRPO","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-10T14:53:35.133157Z"},"links":{"citing_paper":"/paper/2605.04077"},"observation_digest":"sha256:29661cc8b821cb226826025c396be601c78f04f48f380aebd6c716cc3bd54d61","observation_id":"d95e123c-cefd-437d-979e-8175a6a61e12","resolution":{"observed_at":"2026-05-18T11:21:20.345349Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.07974","last_updated":"2024-06-06T17:41:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-03-12T17:58:04Z","title":"LiveCodeBench: Holistic and Contamination Free Evaluation of Large Language Models for Code","version":2},"cited_work":{"arxiv_id":"2403.07974","doi":"10.1109/icsme52107.2021.00025","metadata_source":"pith","pith_arxiv_id":"2403.07974","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"LiveCodeBench: Holistic and Contamination Free Evaluation of Large Language Models for Code","venue":"cs.SE","work_id":"ea9e51ce-1e75-4182-92d8-4d25f70d2ee4","year":2024},"citing_paper":{"arxiv_id":"2605.04077","last_updated":"2026-04-14T09:48:46Z","snapshot_observed_at":"2026-08-03T18:20:15.646381Z","submitted_at":"2026-04-14T09:48:46Z","title":"Balanced Aggregation: Understanding and Fixing Aggregation Bias in GRPO","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-10T14:53:35.133157Z"},"links":{"cited_paper":"/paper/2403.07974","citing_paper":"/paper/2605.04077"},"observation_digest":"sha256:ce201a258a4a2da913c49bd5177b8bc1812468f0ee7adcf45ec7c6450e85f973","observation_id":"c3b6d048-6406-4d07-b0de-7542497de3ab","resolution":{"observed_at":"2026-05-11T11:26:04.734541Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.13786","last_updated":"2025-10-15T17:43:03Z","snapshot_observed_at":"2026-07-06T22:32:47.087967Z","submitted_at":"2025-10-15T17:43:03Z","title":"The Art of Scaling Reinforcement Learning Compute for LLMs","version":1},"cited_work":{"arxiv_id":"2510.13786","doi":"10.48550/arxiv.2510.13786","metadata_source":"pith","pith_arxiv_id":"2510.13786","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"The Art of Scaling Reinforcement Learning Compute for LLMs","venue":"cs.LG","work_id":"7c3dbac0-074a-462c-b23a-b35090f8bf48","year":2025},"citing_paper":{"arxiv_id":"2605.04077","last_updated":"2026-04-14T09:48:46Z","snapshot_observed_at":"2026-08-03T18:20:15.646381Z","submitted_at":"2026-04-14T09:48:46Z","title":"Balanced Aggregation: Understanding and Fixing Aggregation Bias in GRPO","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-10T14:53:35.133157Z"},"links":{"cited_paper":"/paper/2510.13786","citing_paper":"/paper/2605.04077"},"observation_digest":"sha256:e81375fda3b6dd5232cdf4a182471d34e389199d0f9039aa8ad2d341b20b2a4c","observation_id":"5a63f6d2-3f06-4cc1-88fc-82de48b8aa5d","resolution":{"observed_at":"2026-05-16T16:29:14.085942Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2206.14858","last_updated":"2022-07-01T02:15:12Z","snapshot_observed_at":"2026-07-06T13:26:06.337115Z","submitted_at":"2022-06-29T18:54:49Z","title":"Solving Quantitative Reasoning Problems with Language Models","version":2},"cited_work":{"arxiv_id":"2206.14858","doi":"10.48550/arxiv.2206.14858","metadata_source":"pith","pith_arxiv_id":"2206.14858","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Solving Quantitative Reasoning Problems with Language Models","venue":"cs.CL","work_id":"17214d12-1ca8-4186-806d-53c6715383a0","year":2022},"citing_paper":{"arxiv_id":"2605.04077","last_updated":"2026-04-14T09:48:46Z","snapshot_observed_at":"2026-08-03T18:20:15.646381Z","submitted_at":"2026-04-14T09:48:46Z","title":"Balanced Aggregation: Understanding and Fixing Aggregation Bias in GRPO","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-10T14:53:35.133157Z"},"links":{"cited_paper":"/paper/2206.14858","citing_paper":"/paper/2605.04077"},"observation_digest":"sha256:fe00fb69acfaa13de54dc9b45223a5477bcc96486b156aeb2fb188ec336c6193","observation_id":"ab27407c-c671-4305-986c-f5f44e43a829","resolution":{"observed_at":"2026-05-12T22:43:59.458883Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-21T13:53:28.356363+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-21T13:53:28.356363+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.20050","last_updated":"2023-05-31T17:24:00Z","snapshot_observed_at":"2026-07-31T17:40:45.057417Z","submitted_at":"2023-05-31T17:24:00Z","title":"Let's Verify Step by Step","version":1},"cited_work":{"arxiv_id":"2305.20050","doi":"10.1007/bf00262952","metadata_source":"pith","pith_arxiv_id":"2305.20050","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Let's Verify Step by Step","venue":"cs.LG","work_id":"6d05b790-04c5-4fd2-91b2-ba1dfdd5770f","year":2023},"citing_paper":{"arxiv_id":"2605.04077","last_updated":"2026-04-14T09:48:46Z","snapshot_observed_at":"2026-08-03T18:20:15.646381Z","submitted_at":"2026-04-14T09:48:46Z","title":"Balanced Aggregation: Understanding and Fixing Aggregation Bias in GRPO","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-10T14:53:35.133157Z"},"links":{"cited_paper":"/paper/2305.20050","citing_paper":"/paper/2605.04077"},"observation_digest":"sha256:5412a490fe8e929bd6d68f9799270e045001ac9c5a600495d5f2dec38d7e2632","observation_id":"0a107278-ab2f-4440-b8ad-b167c0ea7ae2","resolution":{"observed_at":"2026-05-11T11:26:04.724691Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"When speed kills stability: Demystifying RL collapse from the training-inference mismatch, sep 2025","venue":null,"work_id":"7d99d234-dce0-4b32-bed3-f45b786bc7a4","year":2025},"citing_paper":{"arxiv_id":"2605.04077","last_updated":"2026-04-14T09:48:46Z","snapshot_observed_at":"2026-08-03T18:20:15.646381Z","submitted_at":"2026-04-14T09:48:46Z","title":"Balanced Aggregation: Understanding and Fixing Aggregation Bias in GRPO","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-10T14:53:35.133157Z"},"links":{"citing_paper":"/paper/2605.04077"},"observation_digest":"sha256:4bd29439d3155cd1a363175c03afd4c818bd6e232c310ba3d48fced694a3b301","observation_id":"8ba900d0-bf9d-43fb-add6-c3263eed1c68","resolution":{"observed_at":"2026-05-18T11:21:20.324768Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20783","last_updated":"2025-10-06T09:30:03Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-26T17:59:14Z","title":"Understanding R1-Zero-Like Training: A Critical Perspective","version":2},"cited_work":{"arxiv_id":"2503.20783","doi":"10.48550/arxiv.2503.20783","metadata_source":"pith","pith_arxiv_id":"2503.20783","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Understanding R1-Zero-Like Training: A Critical Perspective","venue":"cs.LG","work_id":"ec354f3b-9484-4a0c-94c8-92d4d0260835","year":2025},"citing_paper":{"arxiv_id":"2605.04077","last_updated":"2026-04-14T09:48:46Z","snapshot_observed_at":"2026-08-03T18:20:15.646381Z","submitted_at":"2026-04-14T09:48:46Z","title":"Balanced Aggregation: Understanding and Fixing Aggregation Bias in GRPO","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-10T14:53:35.133157Z"},"links":{"cited_paper":"/paper/2503.20783","citing_paper":"/paper/2605.04077"},"observation_digest":"sha256:0b4f35e032d5d5ae0066261c01c2db2d890df9269dd21e8561382fdd25e56126","observation_id":"b1e7bdfa-110b-4308-8d7e-8e5e2340dc99","resolution":{"observed_at":"2026-05-11T11:26:04.738791Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-24T09:23:05.84445+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-24T09:23:05.84445+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2508.08221","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T09:09:43.596767Z","title":"Part i: Tricks or traps? a deep dive into rl for llm reasoning","venue":null,"work_id":"e0435aed-9cb6-435b-bb39-63bfca8ed5bd","year":2025},"citing_paper":{"arxiv_id":"2605.04077","last_updated":"2026-04-14T09:48:46Z","snapshot_observed_at":"2026-08-03T18:20:15.646381Z","submitted_at":"2026-04-14T09:48:46Z","title":"Balanced Aggregation: Understanding and Fixing Aggregation Bias in GRPO","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-10T14:53:35.133157Z"},"links":{"citing_paper":"/paper/2605.04077"},"observation_digest":"sha256:5f3d79de4a1cdba8a1930dc73dc7663a64b8226cb46db8173db42dfb60c77843","observation_id":"341b9cd6-8374-41d2-8e61-dd5f19fbd4c8","resolution":{"observed_at":"2026-05-11T11:26:04.667651Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2510.11370","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T22:26:37.153429Z","title":"Stabilizing MoE Reinforcement Learning by Aligning Training and Inference Routers","venue":null,"work_id":"4df9a4a1-3908-4d16-9c0b-253bb245a0c4","year":2025},"citing_paper":{"arxiv_id":"2605.04077","last_updated":"2026-04-14T09:48:46Z","snapshot_observed_at":"2026-08-03T18:20:15.646381Z","submitted_at":"2026-04-14T09:48:46Z","title":"Balanced Aggregation: Understanding and Fixing Aggregation Bias in GRPO","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-10T14:53:35.133157Z"},"links":{"citing_paper":"/paper/2605.04077"},"observation_digest":"sha256:f76d3b313c6b03c95b3da6a37dd6f1632317676be9da839bc73a9bb5d105ec67","observation_id":"cb09adba-3b2b-4458-a298-8f46e1910865","resolution":{"observed_at":"2026-05-11T11:26:04.671207Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.13585","last_updated":"2025-06-16T15:08:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-16T15:08:02Z","title":"MiniMax-M1: Scaling Test-Time Compute Efficiently with Lightning Attention","version":1},"cited_work":{"arxiv_id":"2506.13585","doi":"10.1109/tkde.2022.3168611","metadata_source":"pith","pith_arxiv_id":"2506.13585","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"MiniMax-M1: Scaling Test-Time Compute Efficiently with Lightning Attention","venue":"cs.CL","work_id":"c59fbe20-f41e-4140-a81c-40a12e7e8364","year":2025},"citing_paper":{"arxiv_id":"2605.04077","last_updated":"2026-04-14T09:48:46Z","snapshot_observed_at":"2026-08-03T18:20:15.646381Z","submitted_at":"2026-04-14T09:48:46Z","title":"Balanced Aggregation: Understanding and Fixing Aggregation Bias in GRPO","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-10T14:53:35.133157Z"},"links":{"cited_paper":"/paper/2506.13585","citing_paper":"/paper/2605.04077"},"observation_digest":"sha256:295ef3940019eac0416b2fbd6a66b7ee57867f705faee288a0cbae5c659a85f2","observation_id":"b3e036a8-8ebb-43b7-bced-178e70046601","resolution":{"observed_at":"2026-05-12T09:28:16.586976Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16720","last_updated":"2026-04-30T02:46:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-21T18:04:31Z","title":"OpenAI o1 System Card","version":2},"cited_work":{"arxiv_id":"2412.16720","doi":"10.48550/arxiv.2412.16720","metadata_source":"pith","pith_arxiv_id":"2412.16720","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"OpenAI o1 System Card","venue":"cs.AI","work_id":"68d3c334-0fc9-49e3-b7b0-a69afae933e2","year":2024},"citing_paper":{"arxiv_id":"2605.04077","last_updated":"2026-04-14T09:48:46Z","snapshot_observed_at":"2026-08-03T18:20:15.646381Z","submitted_at":"2026-04-14T09:48:46Z","title":"Balanced Aggregation: Understanding and Fixing Aggregation Bias in GRPO","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-10T14:53:35.133157Z"},"links":{"cited_paper":"/paper/2412.16720","citing_paper":"/paper/2605.04077"},"observation_digest":"sha256:f0719f7290681cd42e4709bf299ce7a68003c983ab32131fd3f9c7b785335626","observation_id":"7044776b-ea3f-4f8e-bf8e-deecf929a894","resolution":{"observed_at":"2026-05-11T11:26:04.647479Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":"1707.06347","doi":"10.1016/j.artint.2010.12.005","metadata_source":"pith","pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Proximal Policy Optimization Algorithms","venue":"cs.LG","work_id":"240c67fe-d14d-4520-91c1-38a4e272ca19","year":2017},"citing_paper":{"arxiv_id":"2605.04077","last_updated":"2026-04-14T09:48:46Z","snapshot_observed_at":"2026-08-03T18:20:15.646381Z","submitted_at":"2026-04-14T09:48:46Z","title":"Balanced Aggregation: Understanding and Fixing Aggregation Bias in GRPO","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-10T14:53:35.133157Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2605.04077"},"observation_digest":"sha256:4cd9eba77aeecdfd9893fa7f014fc4e1a7d24495f7ccc2e7d2c4fd4d8c2ec22c","observation_id":"39166dec-8cb5-46c4-9d29-5926cd8c6210","resolution":{"observed_at":"2026-05-11T11:26:04.683005Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":"2402.03300","doi":"10.1016/0004-3702(73)90011-8","metadata_source":"pith","pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","venue":"cs.CL","work_id":"c5006563-f3ec-438a-9e35-b7b484f34828","year":2024},"citing_paper":{"arxiv_id":"2605.04077","last_updated":"2026-04-14T09:48:46Z","snapshot_observed_at":"2026-08-03T18:20:15.646381Z","submitted_at":"2026-04-14T09:48:46Z","title":"Balanced Aggregation: Understanding and Fixing Aggregation Bias in GRPO","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-10T14:53:35.133157Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2605.04077"},"observation_digest":"sha256:b9f057eb4680346174548c0d8907d947fb4a4784ba08f30c63953e9f727afd49","observation_id":"cbfb241c-9b98-4775-be60-bda02c02e715","resolution":{"observed_at":"2026-05-11T11:26:04.689525Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Opencompass: A universal evaluation platform for foundation models","venue":null,"work_id":"443107ef-c5ba-4582-9f28-d95b4f52e005","year":null},"citing_paper":{"arxiv_id":"2605.04077","last_updated":"2026-04-14T09:48:46Z","snapshot_observed_at":"2026-08-03T18:20:15.646381Z","submitted_at":"2026-04-14T09:48:46Z","title":"Balanced Aggregation: Understanding and Fixing Aggregation Bias in GRPO","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-10T14:53:35.133157Z"},"links":{"citing_paper":"/paper/2605.04077"},"observation_digest":"sha256:710258bf7ee72ad80a93f4455813d5979a36a8492369cccc2270878c39faeaa4","observation_id":"c784cbe9-8f83-4373-a686-8bb6783d64bc","resolution":{"observed_at":"2026-05-18T11:21:20.355195Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.16256","last_updated":"2024-10-21T17:56:51Z","snapshot_observed_at":"2026-07-06T19:37:16.203681Z","submitted_at":"2024-10-21T17:56:51Z","title":"CompassJudger-1: All-in-one Judge Model Helps Model Evaluation and Evolution","version":1},"cited_work":{"arxiv_id":"2410.16256","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.16256","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"CompassJudger-1: All-in-one judge model helps model evaluation and evolution","venue":null,"work_id":"7affdc2b-23ea-499e-8174-c266ef870a54","year":2024},"citing_paper":{"arxiv_id":"2605.04077","last_updated":"2026-04-14T09:48:46Z","snapshot_observed_at":"2026-08-03T18:20:15.646381Z","submitted_at":"2026-04-14T09:48:46Z","title":"Balanced Aggregation: Understanding and Fixing Aggregation Bias in GRPO","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-10T14:53:35.133157Z"},"links":{"cited_paper":"/paper/2410.16256","citing_paper":"/paper/2605.04077"},"observation_digest":"sha256:272099b0314fedddae3ac358bed50ac03d08fa442f9b2f8b301c22f346913680","observation_id":"b92f68a3-4c5a-43b4-a0bc-3aa3aa6c15f0","resolution":{"observed_at":"2026-05-11T11:26:04.658739Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.06062","last_updated":"2026-05-15T05:25:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-10-07T15:54:24Z","title":"When Importance Sampling Misallocates Credit: Asymmetric Ratios for Outcome-Supervised RL","version":2},"cited_work":{"arxiv_id":"2510.06062","doi":null,"metadata_source":"pith","pith_arxiv_id":"2510.06062","snapshot_observed_at":"2026-07-09T22:26:37.216917Z","title":"When Importance Sampling Misallocates Credit: Asymmetric Ratios for Outcome-Supervised RL","venue":"cs.CL","work_id":"9d58b069-561d-440c-9c42-aba858a81448","year":2025},"citing_paper":{"arxiv_id":"2605.04077","last_updated":"2026-04-14T09:48:46Z","snapshot_observed_at":"2026-08-03T18:20:15.646381Z","submitted_at":"2026-04-14T09:48:46Z","title":"Balanced Aggregation: Understanding and Fixing Aggregation Bias in GRPO","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-10T14:53:35.133157Z"},"links":{"cited_paper":"/paper/2510.06062","citing_paper":"/paper/2605.04077"},"observation_digest":"sha256:c2afef3aecaee87a0e32a4db494d3de75871c1819f2b1dda882a424383be3cd6","observation_id":"25cb378c-f7eb-4da7-8bf1-4bccb1395ec8","resolution":{"observed_at":"2026-05-20T00:00:25.356150Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12122","last_updated":"2024-09-18T16:45:37Z","snapshot_observed_at":"2026-07-06T19:17:41.512834Z","submitted_at":"2024-09-18T16:45:37Z","title":"Qwen2.5-Math Technical Report: Toward Mathematical Expert Model via Self-Improvement","version":1},"cited_work":{"arxiv_id":"2409.12122","doi":"10.18653/v1/2025.emnlp-main.712","metadata_source":"pith","pith_arxiv_id":"2409.12122","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen2.5-Math Technical Report: Toward Mathematical Expert Model via Self-Improvement","venue":"cs.CL","work_id":"a097c5d4-6d32-46ee-9826-57d532bbfc9c","year":2024},"citing_paper":{"arxiv_id":"2605.04077","last_updated":"2026-04-14T09:48:46Z","snapshot_observed_at":"2026-08-03T18:20:15.646381Z","submitted_at":"2026-04-14T09:48:46Z","title":"Balanced Aggregation: Understanding and Fixing Aggregation Bias in GRPO","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-10T14:53:35.133157Z"},"links":{"cited_paper":"/paper/2409.12122","citing_paper":"/paper/2605.04077"},"observation_digest":"sha256:ddf8038ce9d0c0e110721d846a9b30086f733c133b6f56a8fa62cc0a2d906f42","observation_id":"91f37ab9-165c-4042-9941-65b18def4bbd","resolution":{"observed_at":"2026-05-11T11:26:04.730699Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":"2505.09388","doi":"10.1016/j.aiopen.2022.12","metadata_source":"pith","pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Qwen3 Technical Report","venue":"cs.CL","work_id":"25a4e30c-1232-48e7-9925-02fa12ba7c9e","year":2025},"citing_paper":{"arxiv_id":"2605.04077","last_updated":"2026-04-14T09:48:46Z","snapshot_observed_at":"2026-08-03T18:20:15.646381Z","submitted_at":"2026-04-14T09:48:46Z","title":"Balanced Aggregation: Understanding and Fixing Aggregation Bias in GRPO","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-10T14:53:35.133157Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2605.04077"},"observation_digest":"sha256:085cae258a20aa2de38762650a078f3f5026699d2c4fad5f26d2249a5eea3f2d","observation_id":"4cb9fe47-170a-4206-a6e0-9ab33945155a","resolution":{"observed_at":"2026-05-11T11:26:04.634949Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Your efficient rl framework secretly brings you off-policy rl training, aug 2025","venue":null,"work_id":"e539ef95-5b42-4905-ba62-d4a7334fabb0","year":2025},"citing_paper":{"arxiv_id":"2605.04077","last_updated":"2026-04-14T09:48:46Z","snapshot_observed_at":"2026-08-03T18:20:15.646381Z","submitted_at":"2026-04-14T09:48:46Z","title":"Balanced Aggregation: Understanding and Fixing Aggregation Bias in GRPO","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-10T14:53:35.133157Z"},"links":{"citing_paper":"/paper/2605.04077"},"observation_digest":"sha256:7cc79d86759ac29365922cb0006d174775e15a288994cac4d0cc9effdf71f107","observation_id":"0a9b4965-476c-4916-ad3b-697a13ac4864","resolution":{"observed_at":"2026-05-18T11:21:20.337051Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14476","last_updated":"2025-05-20T01:37:34Z","snapshot_observed_at":"2026-08-02T01:40:54.187278Z","submitted_at":"2025-03-18T17:49:06Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","version":2},"cited_work":{"arxiv_id":"2503.14476","doi":"10.48550/arxiv.2503.14476","metadata_source":"pith","pith_arxiv_id":"2503.14476","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","venue":"cs.LG","work_id":"64019d00-0b11-4bbd-b173-b46c8fad0157","year":2025},"citing_paper":{"arxiv_id":"2605.04077","last_updated":"2026-04-14T09:48:46Z","snapshot_observed_at":"2026-08-03T18:20:15.646381Z","submitted_at":"2026-04-14T09:48:46Z","title":"Balanced Aggregation: Understanding and Fixing Aggregation Bias in GRPO","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-10T14:53:35.133157Z"},"links":{"cited_paper":"/paper/2503.14476","citing_paper":"/paper/2605.04077"},"observation_digest":"sha256:2757908b2b76d9f68c0f771e099cb894f792350d5791b869356b379190272aad","observation_id":"bce42b06-c2ac-4fea-90e5-3f3fb739f9da","resolution":{"observed_at":"2026-05-11T11:26:04.639218Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-24T09:23:06.254602+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-24T09:23:06.254602+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Scaling of search and learning: A roadmap to reproduce o1 from reinforcement learning perspective","venue":null,"work_id":"2b72e6df-78a5-4431-b006-6e155e140552","year":2024},"citing_paper":{"arxiv_id":"2605.04077","last_updated":"2026-04-14T09:48:46Z","snapshot_observed_at":"2026-08-03T18:20:15.646381Z","submitted_at":"2026-04-14T09:48:46Z","title":"Balanced Aggregation: Understanding and Fixing Aggregation Bias in GRPO","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-10T14:53:35.133157Z"},"links":{"citing_paper":"/paper/2605.04077"},"observation_digest":"sha256:cf7bbccc7bbec72122eff6b170c0041bd998e47c4f6d7f3f0cc603bec8724318","observation_id":"c7ae73c4-ac59-494e-99c4-9fad838e55d0","resolution":{"observed_at":"2026-05-18T11:21:20.328972Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Geometric-mean policy optimization","venue":null,"work_id":"52e503cd-deed-4cae-82e8-0ad800ed5c90","year":null},"citing_paper":{"arxiv_id":"2605.04077","last_updated":"2026-04-14T09:48:46Z","snapshot_observed_at":"2026-08-03T18:20:15.646381Z","submitted_at":"2026-04-14T09:48:46Z","title":"Balanced Aggregation: Understanding and Fixing Aggregation Bias in GRPO","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-10T14:53:35.133157Z"},"links":{"citing_paper":"/paper/2605.04077"},"observation_digest":"sha256:e011ea22408e5bea2d1d9f62c1daf8ad63368f846472db83f9ec7fc06645ef43","observation_id":"417f197f-201b-43ff-a2f1-911c9467be71","resolution":{"observed_at":"2026-05-18T11:21:20.332965Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2507.20673","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T22:26:37.190550Z","title":"Geometric-mean policy optimization","venue":null,"work_id":"a9c27ea5-14a8-4719-a98d-c59a3a8c142a","year":2025},"citing_paper":{"arxiv_id":"2605.04077","last_updated":"2026-04-14T09:48:46Z","snapshot_observed_at":"2026-08-03T18:20:15.646381Z","submitted_at":"2026-04-14T09:48:46Z","title":"Balanced Aggregation: Understanding and Fixing Aggregation Bias in GRPO","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-10T14:53:35.133157Z"},"links":{"citing_paper":"/paper/2605.04077"},"observation_digest":"sha256:63f84bec99f05b04bdfa9c182ec01198f468b23490db54892d4039d81cf9f885","observation_id":"c9207f86-320b-46a1-858b-26b9e0ab66fc","resolution":{"observed_at":"2026-05-11T11:26:04.616905Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.18071","last_updated":"2025-07-28T11:11:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-24T03:50:32Z","title":"Group Sequence Policy Optimization","version":2},"cited_work":{"arxiv_id":"2507.18071","doi":"10.48550/arxiv.2507.18071","metadata_source":"pith","pith_arxiv_id":"2507.18071","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Group Sequence Policy Optimization","venue":"cs.LG","work_id":"3a98b53b-9f52-4d95-adf7-89353c0a9a65","year":2025},"citing_paper":{"arxiv_id":"2605.04077","last_updated":"2026-04-14T09:48:46Z","snapshot_observed_at":"2026-08-03T18:20:15.646381Z","submitted_at":"2026-04-14T09:48:46Z","title":"Balanced Aggregation: Understanding and Fixing Aggregation Bias in GRPO","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-10T14:53:35.133157Z"},"links":{"cited_paper":"/paper/2507.18071","citing_paper":"/paper/2605.04077"},"observation_digest":"sha256:ae7e5fa411d80349679e66dc3cc8df8edee37b98c00e069514d102568e9ddc28","observation_id":"903fd567-d6bc-45b4-b150-5dcadcd2cccc","resolution":{"observed_at":"2026-05-11T11:26:04.630684Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Rloop: An self-improving framework for reinforcement learning with iterative policy initialization","venue":null,"work_id":"41913bf2-3faf-406f-bdf9-a577106a9822","year":null},"citing_paper":{"arxiv_id":"2605.04077","last_updated":"2026-04-14T09:48:46Z","snapshot_observed_at":"2026-08-03T18:20:15.646381Z","submitted_at":"2026-04-14T09:48:46Z","title":"Balanced Aggregation: Understanding and Fixing Aggregation Bias in GRPO","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-10T14:53:35.133157Z"},"links":{"citing_paper":"/paper/2605.04077"},"observation_digest":"sha256:14d92f8fe820891200c2b58cd1ba33607bc1f06d205a76d280a0a5118eeba1d8","observation_id":"f27d840a-d571-415c-93ae-f940d582561b","resolution":{"observed_at":"2026-05-18T11:21:20.341335Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2511.04285","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"14 Appendix A: Why Use Sequence-Count Weights in BA? Here we briefly justify the choice of weights k/G and (G−k)/G in BA","venue":null,"work_id":"f35e4c8f-73b4-43f4-b3c4-6709edd50ad6","year":null},"citing_paper":{"arxiv_id":"2605.04077","last_updated":"2026-04-14T09:48:46Z","snapshot_observed_at":"2026-08-03T18:20:15.646381Z","submitted_at":"2026-04-14T09:48:46Z","title":"Balanced Aggregation: Understanding and Fixing Aggregation Bias in GRPO","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-10T14:53:35.133157Z"},"links":{"citing_paper":"/paper/2605.04077"},"observation_digest":"sha256:680bf174d8171a040e510716542d6b1fdbc1446b621706010f9d80d1c9963925","observation_id":"9788758c-caa1-4f6d-84f0-c343fb9e6a04","resolution":{"observed_at":"2026-05-11T11:26:04.624712Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2605.04077","last_updated":"2026-04-14T09:48:46Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-03T18:20:15.646381Z","submitted_at":"2026-04-14T09:48:46Z","title":"Balanced Aggregation: Understanding and Fixing Aggregation Bias in GRPO"},"reference_resolution":{"displayed":29,"state_counts":{"malformed_identifier":0,"metadata_mismatch":2,"parse_uncertain":0,"unresolved":0,"verified_exact":19,"verified_fuzzy":8},"total_outbound_references":29},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"thesis":"As of 5 August 2026, this Paper Citation Record lists 29 of 29 outbound references and 1 inbound Pith citation observation for arXiv:2605.04077."}