{"as_of":"2026-08-17T05:25:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:1647dcc8f70b1d0ecceea629f9098a909dccff61411545846a2d9b3fca9a0f08","coverage":[{"denominator":42,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":42,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T20:40:13.165308Z","state":"measured"},{"denominator":77,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":77,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-16T06:30:59.297886+00:00","state":"measured"},{"denominator":35,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":35,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T20:07:05.170825Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T13:49:52.427933Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.12346","last_updated":"2025-05-18T10:20:59Z","snapshot_observed_at":"2026-08-16T10:20:08.742919Z","submitted_at":"2025-05-18T10:20:59Z","title":"SEED-GRPO: Semantic Entropy Enhanced GRPO for Uncertainty-Aware Policy Optimization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.12346","snapshot_observed_at":"2026-08-07T12:22:12.190500Z","title":"Seed-grpo: Semantic entropy enhanced grpo for uncertainty-aware policy optimization,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.24718","last_updated":"2025-06-08T14:43:47Z","snapshot_observed_at":"2026-08-14T19:57:36.845039Z","submitted_at":"2025-05-30T15:42:19Z","title":"Reinforcing Video Reasoning with Focused Thinking","version":3},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T12:22:12.190500Z"},"links":{"cited_paper":"/paper/2505.12346","citing_paper":"/paper/2505.24718"},"observation_digest":"sha256:b97bbf1babff88adb04d363fb2ef9bd9c1755759824d18380546f5c55668c5b8","observation_id":"7b4aba80-d73a-4225-914e-cd2b8ce53e20","resolution":{"observed_at":"2026-08-07T12:22:12.190500Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.12346","last_updated":"2025-05-18T10:20:59Z","snapshot_observed_at":"2026-08-16T10:20:08.742919Z","submitted_at":"2025-05-18T10:20:59Z","title":"SEED-GRPO: Semantic Entropy Enhanced GRPO for Uncertainty-Aware Policy Optimization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.12346","snapshot_observed_at":"2026-08-15T20:07:05.170825Z","title":"Seed-grpo: Semantic entropy enhanced grpo for uncertainty-aware policy optimization.arXiv preprint arXiv:2505.12346, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.13358","last_updated":"2025-06-16T10:57:58Z","snapshot_observed_at":"2026-08-16T05:19:28.570084Z","submitted_at":"2025-06-16T10:57:58Z","title":"Socratic RL: A Novel Framework for Efficient Knowledge Acquisition through Iterative Reflection and Viewpoint Distillation","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-15T20:07:05.170825Z"},"links":{"cited_paper":"/paper/2505.12346","citing_paper":"/paper/2506.13358"},"observation_digest":"sha256:07e499c2db4f84b30713f7e1bdff3692c355cc06e37aa417e49377f8ba8539b7","observation_id":"0b9f6000-6e9b-48f9-87c5-38a7c22a23d0","resolution":{"observed_at":"2026-08-15T20:07:05.170825Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.12346","last_updated":"2025-05-18T10:20:59Z","snapshot_observed_at":"2026-08-16T10:20:08.742919Z","submitted_at":"2025-05-18T10:20:59Z","title":"SEED-GRPO: Semantic Entropy Enhanced GRPO for Uncertainty-Aware Policy Optimization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.12346","snapshot_observed_at":"2026-08-06T18:59:40.639865Z","title":"Seed-grpo: Semantic entropy enhanced grpo for uncertainty-aware policy optimization","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.06829","last_updated":"2025-07-09T13:28:35Z","snapshot_observed_at":"2026-08-14T11:34:23.064858Z","submitted_at":"2025-07-09T13:28:35Z","title":"Adaptive Termination for Multi-round Parallel Reasoning: An Universal Semantic Entropy-Guided Framework","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-06T18:59:40.639865Z"},"links":{"cited_paper":"/paper/2505.12346","citing_paper":"/paper/2507.06829"},"observation_digest":"sha256:c3cd59aa14fd3f3042399f2051190c7d6fc96fd2b51fad4a13b091764efa3776","observation_id":"51f79782-9ec8-4f33-83a3-77ede35621bd","resolution":{"observed_at":"2026-08-06T18:59:40.639865Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.12346","last_updated":"2025-05-18T10:20:59Z","snapshot_observed_at":"2026-08-16T10:20:08.742919Z","submitted_at":"2025-05-18T10:20:59Z","title":"SEED-GRPO: Semantic Entropy Enhanced GRPO for Uncertainty-Aware Policy Optimization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.12346","snapshot_observed_at":"2026-08-06T12:26:11.122616Z","title":"arXiv preprint arXiv:2505.12346","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.21848","last_updated":"2025-07-29T14:23:58Z","snapshot_observed_at":"2026-08-12T17:04:33.528419Z","submitted_at":"2025-07-29T14:23:58Z","title":"EDGE-GRPO: Entropy-Driven GRPO with Guided Error Correction for Advantage Diversity","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-06T12:26:11.122616Z"},"links":{"cited_paper":"/paper/2505.12346","citing_paper":"/paper/2507.21848"},"observation_digest":"sha256:d116510bce8b0b613c8ca4949bb71edc359c23f12c668572463843b3d120ad09","observation_id":"69b01b73-13c2-4459-890e-334ee896733b","resolution":{"observed_at":"2026-08-06T12:26:11.122616Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.12346","last_updated":"2025-05-18T10:20:59Z","snapshot_observed_at":"2026-08-16T10:20:08.742919Z","submitted_at":"2025-05-18T10:20:59Z","title":"SEED-GRPO: Semantic Entropy Enhanced GRPO for Uncertainty-Aware Policy Optimization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.12346","snapshot_observed_at":"2026-08-05T23:10:24.452911Z","title":"Seed-grpo: Semantic entropy enhanced grpo for uncertainty-aware policy optimization","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.05928","last_updated":"2025-08-08T01:24:06Z","snapshot_observed_at":"2026-08-13T20:01:20.217289Z","submitted_at":"2025-08-08T01:24:06Z","title":"Mitigating Think-Answer Mismatch in LLM Reasoning Through Noise-Aware Advantage Reweighting","version":1},"reference_index":1988,"source":"pdf_text","source_observed_at":"2026-08-05T23:10:24.452911Z"},"links":{"cited_paper":"/paper/2505.12346","citing_paper":"/paper/2508.05928"},"observation_digest":"sha256:33d2e70f26f0fafe25be96a518c61e770c213f97e7e36d26d00c574e72364d87","observation_id":"892fbaba-8018-4613-907c-bbe0cdaaa6cc","resolution":{"observed_at":"2026-08-05T23:10:24.452911Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.12346","last_updated":"2025-05-18T10:20:59Z","snapshot_observed_at":"2026-08-16T10:20:08.742919Z","submitted_at":"2025-05-18T10:20:59Z","title":"SEED-GRPO: Semantic Entropy Enhanced GRPO for Uncertainty-Aware Policy Optimization","version":1},"cited_work":{"arxiv_id":"2505.12346","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.12346","snapshot_observed_at":"2026-07-04T13:49:52.427933Z","title":"arXiv preprint arXiv:2505.12346 , year=","venue":null,"work_id":"1a5aa60e-eb9c-41b1-968f-cfa8336af063","year":2025},"citing_paper":{"arxiv_id":"2509.08827","last_updated":"2025-10-09T17:08:52Z","snapshot_observed_at":"2026-08-06T15:38:05.011922Z","submitted_at":"2025-09-10T17:59:43Z","title":"A Survey of Reinforcement Learning for Large Reasoning Models","version":3},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-05-18T00:02:24.352947Z"},"links":{"cited_paper":"/paper/2505.12346","citing_paper":"/paper/2509.08827"},"observation_digest":"sha256:55227918779440ed8ecf60aa7d8cb0006df8b74787aec8e12a7fa6d65ea83e63","observation_id":"1d7da6ce-8da8-4a9a-8688-18fe4b8d55e8","resolution":{"observed_at":"2026-05-18T00:02:25.084591Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.12346","last_updated":"2025-05-18T10:20:59Z","snapshot_observed_at":"2026-08-16T10:20:08.742919Z","submitted_at":"2025-05-18T10:20:59Z","title":"SEED-GRPO: Semantic Entropy Enhanced GRPO for Uncertainty-Aware Policy Optimization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.12346","snapshot_observed_at":"2026-08-04T19:28:56.258016Z","title":"Seed-grpo: Semantic entropy enhanced grpo for uncertainty-aware policy optimization","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.09265","last_updated":"2025-09-11T08:50:01Z","snapshot_observed_at":"2026-08-12T18:24:04.714959Z","submitted_at":"2025-09-11T08:50:01Z","title":"Harnessing Uncertainty: Entropy-Modulated Policy Gradients for Long-Horizon LLM Agents","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-04T19:28:56.258016Z"},"links":{"cited_paper":"/paper/2505.12346","citing_paper":"/paper/2509.09265"},"observation_digest":"sha256:66f3fbc85eee3479ffc19e9e8e0eb4cf616ecb30fd10a5500165225c688869b5","observation_id":"2e325a43-c496-45a7-97ee-128721ef66f1","resolution":{"observed_at":"2026-08-04T19:28:56.258016Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.12346","last_updated":"2025-05-18T10:20:59Z","snapshot_observed_at":"2026-08-16T10:20:08.742919Z","submitted_at":"2025-05-18T10:20:59Z","title":"SEED-GRPO: Semantic Entropy Enhanced GRPO for Uncertainty-Aware Policy Optimization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.12346","snapshot_observed_at":"2026-08-04T11:23:20.055373Z","title":"Seed-grpo: Semantic entropy enhanced grpo for uncertainty- aware policy optimization,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.05478","last_updated":"2026-06-08T05:16:04Z","snapshot_observed_at":"2026-08-04T21:47:56.469923Z","submitted_at":"2025-10-07T00:39:14Z","title":"AQA-TTRL: Self-Adaptation in Audio Question Answering with Test-Time Reinforcement Learning","version":3},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-04T11:23:20.055373Z"},"links":{"cited_paper":"/paper/2505.12346","citing_paper":"/paper/2510.05478"},"observation_digest":"sha256:e454520c5b3d45113bcd6e795873db6aaef6a9b7bf1f6ac7bae6e865b1978887","observation_id":"fbe99f8e-e2ae-4851-85b9-d275d025b811","resolution":{"observed_at":"2026-08-04T11:23:20.055373Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.12346","last_updated":"2025-05-18T10:20:59Z","snapshot_observed_at":"2026-08-16T10:20:08.742919Z","submitted_at":"2025-05-18T10:20:59Z","title":"SEED-GRPO: Semantic Entropy Enhanced GRPO for Uncertainty-Aware Policy Optimization","version":1},"cited_work":{"arxiv_id":"2505.12346","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.12346","snapshot_observed_at":"2026-07-04T13:49:52.427933Z","title":"arXiv preprint arXiv:2505.12346 , year=","venue":null,"work_id":"1a5aa60e-eb9c-41b1-968f-cfa8336af063","year":2025},"citing_paper":{"arxiv_id":"2510.10649","last_updated":"2026-04-16T14:51:36Z","snapshot_observed_at":"2026-08-12T17:08:23.428596Z","submitted_at":"2025-10-12T15:06:53Z","title":"Unlocking Exploration in RLVR: Uncertainty-aware Advantage Shaping for Deeper Reasoning","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-18T07:20:01.505216Z"},"links":{"cited_paper":"/paper/2505.12346","citing_paper":"/paper/2510.10649"},"observation_digest":"sha256:5705ae047143dfbb6f6be66a7830f9c1ab9637189e04e3a80df124909e954fe9","observation_id":"9d457360-c1b1-41e6-8da8-77d54a0f8373","resolution":{"observed_at":"2026-05-18T07:21:04.407632Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.12346","last_updated":"2025-05-18T10:20:59Z","snapshot_observed_at":"2026-08-16T10:20:08.742919Z","submitted_at":"2025-05-18T10:20:59Z","title":"SEED-GRPO: Semantic Entropy Enhanced GRPO for Uncertainty-Aware Policy Optimization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.12346","snapshot_observed_at":"2026-08-03T11:13:16.768253Z","title":"Seed-grpo: Semantic entropy enhanced grpo for uncertainty-aware policy optimization.arXiv preprint arXiv:2505.12346, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.07298","last_updated":"2026-06-21T08:39:33Z","snapshot_observed_at":"2026-08-08T14:41:26.174719Z","submitted_at":"2026-01-12T08:15:36Z","title":"Mimic Human Cognition, Master Multi-Image Reasoning: A Meta-Action Framework for Enhanced Visual Understanding","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-03T11:13:16.768253Z"},"links":{"cited_paper":"/paper/2505.12346","citing_paper":"/paper/2601.07298"},"observation_digest":"sha256:e1098c7f37d324492a23888561ce00cf6238739078a282e654471ba8a83060fb","observation_id":"f273ed6b-ec28-433b-b6e8-b982d2353ee8","resolution":{"observed_at":"2026-08-03T11:13:16.768253Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.12346","last_updated":"2025-05-18T10:20:59Z","snapshot_observed_at":"2026-08-16T10:20:08.742919Z","submitted_at":"2025-05-18T10:20:59Z","title":"SEED-GRPO: Semantic Entropy Enhanced GRPO for Uncertainty-Aware Policy Optimization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.12346","snapshot_observed_at":"2026-08-02T20:14:03.940645Z","title":"Seed-grpo: Semantic entropy enhanced grpo for uncertainty-aware policy optimization.arXiv preprint arXiv:2505.12346, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.23802","last_updated":"2026-07-08T14:47:50Z","snapshot_observed_at":"2026-08-13T22:48:49.325123Z","submitted_at":"2026-02-27T08:42:52Z","title":"EMO-R3: Reflective Reinforcement Learning for Emotional Reasoning in Multimodal Large Language Models","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-02T20:14:03.940645Z"},"links":{"cited_paper":"/paper/2505.12346","citing_paper":"/paper/2602.23802"},"observation_digest":"sha256:6cde7916c28ebf9fdada45ce16ab0eca6875ed522685c0b42bac59a40efec6a6","observation_id":"4b031acc-1e60-4a7e-9592-a5d988094944","resolution":{"observed_at":"2026-08-02T20:14:03.940645Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.12346","last_updated":"2025-05-18T10:20:59Z","snapshot_observed_at":"2026-08-16T10:20:08.742919Z","submitted_at":"2025-05-18T10:20:59Z","title":"SEED-GRPO: Semantic Entropy Enhanced GRPO for Uncertainty-Aware Policy Optimization","version":1},"cited_work":{"arxiv_id":"2505.12346","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.12346","snapshot_observed_at":"2026-07-04T13:49:52.427933Z","title":"arXiv preprint arXiv:2505.12346 , year=","venue":null,"work_id":"1a5aa60e-eb9c-41b1-968f-cfa8336af063","year":2025},"citing_paper":{"arxiv_id":"2604.03128","last_updated":"2026-04-08T08:22:36Z","snapshot_observed_at":"2026-08-03T04:49:13.270533Z","submitted_at":"2026-04-03T15:50:07Z","title":"Self-Distilled RLVR","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-13T19:43:46.623267Z"},"links":{"cited_paper":"/paper/2505.12346","citing_paper":"/paper/2604.03128"},"observation_digest":"sha256:dff1d0cf2b3870888c7939f741e979dc301046c27d22188eef14913a57fcae89","observation_id":"da19f184-186d-4aed-b54c-74ac41b3cf70","resolution":{"observed_at":"2026-05-13T19:48:11.563241Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.12346","last_updated":"2025-05-18T10:20:59Z","snapshot_observed_at":"2026-08-16T10:20:08.742919Z","submitted_at":"2025-05-18T10:20:59Z","title":"SEED-GRPO: Semantic Entropy Enhanced GRPO for Uncertainty-Aware Policy Optimization","version":1},"cited_work":{"arxiv_id":"2505.12346","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.12346","snapshot_observed_at":"2026-07-04T13:49:52.427933Z","title":"arXiv preprint arXiv:2505.12346 , year=","venue":null,"work_id":"1a5aa60e-eb9c-41b1-968f-cfa8336af063","year":2025},"citing_paper":{"arxiv_id":"2604.06804","last_updated":"2026-04-08T08:17:25Z","snapshot_observed_at":"2026-08-13T14:31:33.974058Z","submitted_at":"2026-04-08T08:17:25Z","title":"LASER: A Data-Centric Method for Low-Cost and Efficient SQL Rewriting based on SQL-GRPO","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-10T17:15:04.225059Z"},"links":{"cited_paper":"/paper/2505.12346","citing_paper":"/paper/2604.06804"},"observation_digest":"sha256:fb5f09b3cebb4fa3acf67b382865b1b1ebf305c736058a9931a8513a5646eac1","observation_id":"97aa497d-3246-4818-8110-ce4dfb077a56","resolution":{"observed_at":"2026-05-11T07:16:02.244538Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.12346","last_updated":"2025-05-18T10:20:59Z","snapshot_observed_at":"2026-08-16T10:20:08.742919Z","submitted_at":"2025-05-18T10:20:59Z","title":"SEED-GRPO: Semantic Entropy Enhanced GRPO for Uncertainty-Aware Policy Optimization","version":1},"cited_work":{"arxiv_id":"2505.12346","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.12346","snapshot_observed_at":"2026-07-04T13:49:52.427933Z","title":"arXiv preprint arXiv:2505.12346 , year=","venue":null,"work_id":"1a5aa60e-eb9c-41b1-968f-cfa8336af063","year":2025},"citing_paper":{"arxiv_id":"2604.17928","last_updated":"2026-04-20T08:09:01Z","snapshot_observed_at":"2026-08-14T00:24:03.820656Z","submitted_at":"2026-04-20T08:09:01Z","title":"HEALing Entropy Collapse: Enhancing Exploration in Few-Shot RLVR via Hybrid-Domain Entropy Dynamics Alignment","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-05-10T05:23:08.478393Z"},"links":{"cited_paper":"/paper/2505.12346","citing_paper":"/paper/2604.17928"},"observation_digest":"sha256:1d32248536a92aa4f3bfdbe103af84e9d3ed447d67676e43e2810710796d1cc4","observation_id":"caa9ebf4-db47-47db-b183-b28db1c89bbc","resolution":{"observed_at":"2026-05-10T05:25:55.199930Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.12346","last_updated":"2025-05-18T10:20:59Z","snapshot_observed_at":"2026-08-16T10:20:08.742919Z","submitted_at":"2025-05-18T10:20:59Z","title":"SEED-GRPO: Semantic Entropy Enhanced GRPO for Uncertainty-Aware Policy Optimization","version":1},"cited_work":{"arxiv_id":"2505.12346","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.12346","snapshot_observed_at":"2026-07-04T13:49:52.427933Z","title":"arXiv preprint arXiv:2505.12346 , year=","venue":null,"work_id":"1a5aa60e-eb9c-41b1-968f-cfa8336af063","year":2025},"citing_paper":{"arxiv_id":"2604.25591","last_updated":"2026-04-28T12:56:22Z","snapshot_observed_at":"2026-08-11T04:21:44.774351Z","submitted_at":"2026-04-28T12:56:22Z","title":"Walking Through Uncertainty: An Empirical Study of Uncertainty Estimation for Audio-Aware Large Language Models","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-05-07T14:29:18.348031Z"},"links":{"cited_paper":"/paper/2505.12346","citing_paper":"/paper/2604.25591"},"observation_digest":"sha256:25fc854c5ec7d86a9067d395fb9d3f91ce40793f661dcd5fc351e11600c1157f","observation_id":"40b4c59d-42a6-46d5-a2f3-85242df039df","resolution":{"observed_at":"2026-05-12T00:41:26.300159Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.12346","last_updated":"2025-05-18T10:20:59Z","snapshot_observed_at":"2026-08-16T10:20:08.742919Z","submitted_at":"2025-05-18T10:20:59Z","title":"SEED-GRPO: Semantic Entropy Enhanced GRPO for Uncertainty-Aware Policy Optimization","version":1},"cited_work":{"arxiv_id":"2505.12346","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.12346","snapshot_observed_at":"2026-07-04T13:49:52.427933Z","title":"arXiv preprint arXiv:2505.12346 , year=","venue":null,"work_id":"1a5aa60e-eb9c-41b1-968f-cfa8336af063","year":2025},"citing_paper":{"arxiv_id":"2605.02178","last_updated":"2026-05-04T03:15:56Z","snapshot_observed_at":"2026-08-12T12:40:32.507029Z","submitted_at":"2026-05-04T03:15:56Z","title":"T$^2$PO: Uncertainty-Guided Exploration Control for Stable Multi-Turn Agentic Reinforcement Learning","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-08T19:36:00.359351Z"},"links":{"cited_paper":"/paper/2505.12346","citing_paper":"/paper/2605.02178"},"observation_digest":"sha256:e86c0d77d48f9c1d697576ad3dac77cf9b0650fbbcf80a8416fbaad777490234","observation_id":"131bf09f-eb00-4823-b093-0ab1106f3131","resolution":{"observed_at":"2026-05-09T05:45:22.128262Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.12346","last_updated":"2025-05-18T10:20:59Z","snapshot_observed_at":"2026-08-16T10:20:08.742919Z","submitted_at":"2025-05-18T10:20:59Z","title":"SEED-GRPO: Semantic Entropy Enhanced GRPO for Uncertainty-Aware Policy Optimization","version":1},"cited_work":{"arxiv_id":"2505.12346","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.12346","snapshot_observed_at":"2026-07-04T13:49:52.427933Z","title":"arXiv preprint arXiv:2505.12346 , year=","venue":null,"work_id":"1a5aa60e-eb9c-41b1-968f-cfa8336af063","year":2025},"citing_paper":{"arxiv_id":"2605.02913","last_updated":"2026-04-08T00:53:29Z","snapshot_observed_at":"2026-08-13T10:36:16.468710Z","submitted_at":"2026-04-08T00:53:29Z","title":"Generate, Filter, Control, Replay: A Comprehensive Survey of Rollout Strategies for LLM Reinforcement Learning","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-05-10T19:15:27.406778Z"},"links":{"cited_paper":"/paper/2505.12346","citing_paper":"/paper/2605.02913"},"observation_digest":"sha256:78ddfb900c3021780440e0ca78fce14df3f682537b336e8c65e44173563f0ae4","observation_id":"c9ae2cc9-c05b-4afd-b031-5b719c166158","resolution":{"observed_at":"2026-05-10T23:15:48.864199Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.12346","last_updated":"2025-05-18T10:20:59Z","snapshot_observed_at":"2026-08-16T10:20:08.742919Z","submitted_at":"2025-05-18T10:20:59Z","title":"SEED-GRPO: Semantic Entropy Enhanced GRPO for Uncertainty-Aware Policy Optimization","version":1},"cited_work":{"arxiv_id":"2505.12346","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.12346","snapshot_observed_at":"2026-07-04T13:49:52.427933Z","title":"arXiv preprint arXiv:2505.12346 , year=","venue":null,"work_id":"1a5aa60e-eb9c-41b1-968f-cfa8336af063","year":2025},"citing_paper":{"arxiv_id":"2605.04984","last_updated":"2026-05-06T14:38:48Z","snapshot_observed_at":"2026-08-12T20:56:42.323513Z","submitted_at":"2026-05-06T14:38:48Z","title":"Self-Induced Outcome Potential: Turn-Level Credit Assignment for Agents without Verifiers","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-08T17:11:31.826233Z"},"links":{"cited_paper":"/paper/2505.12346","citing_paper":"/paper/2605.04984"},"observation_digest":"sha256:2a81433c19aa49d65eedb75f01076c0ba85f9e03d83b1f679470d6dd21a289d7","observation_id":"7ddcc6ed-9c0a-4a53-b513-ecf095e389f3","resolution":{"observed_at":"2026-05-11T17:46:09.550349Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.12346","last_updated":"2025-05-18T10:20:59Z","snapshot_observed_at":"2026-08-16T10:20:08.742919Z","submitted_at":"2025-05-18T10:20:59Z","title":"SEED-GRPO: Semantic Entropy Enhanced GRPO for Uncertainty-Aware Policy Optimization","version":1},"cited_work":{"arxiv_id":"2505.12346","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.12346","snapshot_observed_at":"2026-07-04T13:49:52.427933Z","title":"arXiv preprint arXiv:2505.12346 , year=","venue":null,"work_id":"1a5aa60e-eb9c-41b1-968f-cfa8336af063","year":2025},"citing_paper":{"arxiv_id":"2605.08186","last_updated":"2026-05-05T12:00:06Z","snapshot_observed_at":"2026-08-02T05:15:18.309649Z","submitted_at":"2026-05-05T12:00:06Z","title":"Rethinking Entropy Minimization in Test-Time Adaptation for Autoregressive Models","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-12T00:48:47.213681Z"},"links":{"cited_paper":"/paper/2505.12346","citing_paper":"/paper/2605.08186"},"observation_digest":"sha256:be99812bce56e1262358dd38a3cd4c4728e95b34cfd8da9dc2b7773d1981a1da","observation_id":"6c96d400-c4e2-4a8f-8d3c-f44cd106e081","resolution":{"observed_at":"2026-05-12T08:41:24.629634Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.12346","last_updated":"2025-05-18T10:20:59Z","snapshot_observed_at":"2026-08-16T10:20:08.742919Z","submitted_at":"2025-05-18T10:20:59Z","title":"SEED-GRPO: Semantic Entropy Enhanced GRPO for Uncertainty-Aware Policy Optimization","version":1},"cited_work":{"arxiv_id":"2505.12346","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.12346","snapshot_observed_at":"2026-07-04T13:49:52.427933Z","title":"arXiv preprint arXiv:2505.12346 , year=","venue":null,"work_id":"1a5aa60e-eb9c-41b1-968f-cfa8336af063","year":2025},"citing_paper":{"arxiv_id":"2605.08441","last_updated":"2026-05-08T20:03:19Z","snapshot_observed_at":"2026-08-11T08:24:15.849440Z","submitted_at":"2026-05-08T20:03:19Z","title":"DUET: Optimize Token-Budget Allocation for Reinforcement Learning with Verifiable Rewards","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-12T01:57:11.065744Z"},"links":{"cited_paper":"/paper/2505.12346","citing_paper":"/paper/2605.08441"},"observation_digest":"sha256:caa9bff294fe2411a6ac1255f60c6a60d8c699f14ca8cfb0bb9daf8f30b6fd76","observation_id":"7f265df0-44b6-4a12-a82c-653cfcab9e64","resolution":{"observed_at":"2026-05-12T07:46:29.447553Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.12346","last_updated":"2025-05-18T10:20:59Z","snapshot_observed_at":"2026-08-16T10:20:08.742919Z","submitted_at":"2025-05-18T10:20:59Z","title":"SEED-GRPO: Semantic Entropy Enhanced GRPO for Uncertainty-Aware Policy Optimization","version":1},"cited_work":{"arxiv_id":"2505.12346","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.12346","snapshot_observed_at":"2026-07-04T13:49:52.427933Z","title":"arXiv preprint arXiv:2505.12346 , year=","venue":null,"work_id":"1a5aa60e-eb9c-41b1-968f-cfa8336af063","year":2025},"citing_paper":{"arxiv_id":"2605.12058","last_updated":"2026-05-21T13:10:04Z","snapshot_observed_at":"2026-08-11T08:07:08.891786Z","submitted_at":"2026-05-12T12:45:03Z","title":"Holder Policy Optimisation","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-05-13T06:08:28.855671Z"},"links":{"cited_paper":"/paper/2505.12346","citing_paper":"/paper/2605.12058"},"observation_digest":"sha256:82f74b97d790e1968678d4fa9d0d949accf690ef52653fd22d9fd876003a01d9","observation_id":"da4eb23b-efe3-4d94-bfdc-eed8427c032c","resolution":{"observed_at":"2026-05-13T06:12:22.790348Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.12346","last_updated":"2025-05-18T10:20:59Z","snapshot_observed_at":"2026-08-16T10:20:08.742919Z","submitted_at":"2025-05-18T10:20:59Z","title":"SEED-GRPO: Semantic Entropy Enhanced GRPO for Uncertainty-Aware Policy Optimization","version":1},"cited_work":{"arxiv_id":"2505.12346","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.12346","snapshot_observed_at":"2026-07-04T13:49:52.427933Z","title":"arXiv preprint arXiv:2505.12346 , year=","venue":null,"work_id":"1a5aa60e-eb9c-41b1-968f-cfa8336af063","year":2025},"citing_paper":{"arxiv_id":"2605.12058","last_updated":"2026-05-21T13:10:04Z","snapshot_observed_at":"2026-08-11T08:07:08.891786Z","submitted_at":"2026-05-12T12:45:03Z","title":"Holder Policy Optimisation","version":2},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-05-22T10:00:58.600743Z"},"links":{"cited_paper":"/paper/2505.12346","citing_paper":"/paper/2605.12058"},"observation_digest":"sha256:301392955374b9dd5a067d7b408cac0fc450a5dc66319d51b19417a2e2dfad68","observation_id":"94c188f2-641f-4ea3-8252-6faeb9c094f9","resolution":{"observed_at":"2026-05-22T10:01:23.115200Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.12346","last_updated":"2025-05-18T10:20:59Z","snapshot_observed_at":"2026-08-16T10:20:08.742919Z","submitted_at":"2025-05-18T10:20:59Z","title":"SEED-GRPO: Semantic Entropy Enhanced GRPO for Uncertainty-Aware Policy Optimization","version":1},"cited_work":{"arxiv_id":"2505.12346","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.12346","snapshot_observed_at":"2026-07-04T13:49:52.427933Z","title":"arXiv preprint arXiv:2505.12346 , year=","venue":null,"work_id":"1a5aa60e-eb9c-41b1-968f-cfa8336af063","year":2025},"citing_paper":{"arxiv_id":"2605.19447","last_updated":"2026-05-19T07:00:55Z","snapshot_observed_at":"2026-08-16T03:38:09.760229Z","submitted_at":"2026-05-19T07:00:55Z","title":"What and When to Distill: Selective Hindsight Distillation for Multi-Turn Agents","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-20T05:41:23.712146Z"},"links":{"cited_paper":"/paper/2505.12346","citing_paper":"/paper/2605.19447"},"observation_digest":"sha256:1dd4660400b8e136a09cd51321e570827534656b89bdca3cbba610528b488117","observation_id":"0a337026-3afb-47eb-956a-f88f1dcfd852","resolution":{"observed_at":"2026-05-20T05:43:05.721502Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.12346","last_updated":"2025-05-18T10:20:59Z","snapshot_observed_at":"2026-08-16T10:20:08.742919Z","submitted_at":"2025-05-18T10:20:59Z","title":"SEED-GRPO: Semantic Entropy Enhanced GRPO for Uncertainty-Aware Policy Optimization","version":1},"cited_work":{"arxiv_id":"2505.12346","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.12346","snapshot_observed_at":"2026-07-04T13:49:52.427933Z","title":"arXiv preprint arXiv:2505.12346 , year=","venue":null,"work_id":"1a5aa60e-eb9c-41b1-968f-cfa8336af063","year":2025},"citing_paper":{"arxiv_id":"2605.21801","last_updated":"2026-05-20T22:59:02Z","snapshot_observed_at":"2026-07-31T22:43:35.705855Z","submitted_at":"2026-05-20T22:59:02Z","title":"Why Semantic Entropy Fails: Geometry-Aware and Calibrated Uncertainty for Policy Optimization","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-22T08:53:02.051453Z"},"links":{"cited_paper":"/paper/2505.12346","citing_paper":"/paper/2605.21801"},"observation_digest":"sha256:66eb937749ed070b0a10d28ace9afa3625547c6aa674141622f4c08ff168c7dc","observation_id":"82fbf2f1-0959-46e2-a70b-f94cd95608b1","resolution":{"observed_at":"2026-05-22T08:54:45.757498Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.12346","last_updated":"2025-05-18T10:20:59Z","snapshot_observed_at":"2026-08-16T10:20:08.742919Z","submitted_at":"2025-05-18T10:20:59Z","title":"SEED-GRPO: Semantic Entropy Enhanced GRPO for Uncertainty-Aware Policy Optimization","version":1},"cited_work":{"arxiv_id":"2505.12346","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.12346","snapshot_observed_at":"2026-07-04T13:49:52.427933Z","title":"arXiv preprint arXiv:2505.12346 , year=","venue":null,"work_id":"1a5aa60e-eb9c-41b1-968f-cfa8336af063","year":2025},"citing_paper":{"arxiv_id":"2606.01249","last_updated":"2026-06-17T04:44:10Z","snapshot_observed_at":"2026-08-12T03:28:30.781632Z","submitted_at":"2026-05-31T14:04:51Z","title":"Trust Region On-Policy Distillation","version":3},"reference_index":95,"source":"arxiv_source","source_observed_at":"2026-06-28T17:38:50.313305Z"},"links":{"cited_paper":"/paper/2505.12346","citing_paper":"/paper/2606.01249"},"observation_digest":"sha256:3db3a4e87b0ee863518972f53c12d17c8b11345cfd0f2e12b84e46b08892945f","observation_id":"45242034-0215-4725-8b8e-0e4ae85a8d30","resolution":{"observed_at":"2026-07-01T20:56:13.407524Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.12346","last_updated":"2025-05-18T10:20:59Z","snapshot_observed_at":"2026-08-16T10:20:08.742919Z","submitted_at":"2025-05-18T10:20:59Z","title":"SEED-GRPO: Semantic Entropy Enhanced GRPO for Uncertainty-Aware Policy Optimization","version":1},"cited_work":{"arxiv_id":"2505.12346","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.12346","snapshot_observed_at":"2026-07-04T13:49:52.427933Z","title":"arXiv preprint arXiv:2505.12346 , year=","venue":null,"work_id":"1a5aa60e-eb9c-41b1-968f-cfa8336af063","year":2025},"citing_paper":{"arxiv_id":"2606.03094","last_updated":"2026-06-02T03:32:32Z","snapshot_observed_at":"2026-08-13T03:32:17.136484Z","submitted_at":"2026-06-02T03:32:32Z","title":"FGRPO: Federated GRPO with Adaptive Aggregation on Non-IID Data","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-06-28T11:44:53.211503Z"},"links":{"cited_paper":"/paper/2505.12346","citing_paper":"/paper/2606.03094"},"observation_digest":"sha256:0f3422d97ce39e354ec930caefe4ab18733c918f312eb3bc07b35a6e8dde4a63","observation_id":"7416aa03-8007-4fb4-a17f-6c2dc8e53bbf","resolution":{"observed_at":"2026-07-02T01:36:25.608391Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.12346","last_updated":"2025-05-18T10:20:59Z","snapshot_observed_at":"2026-08-16T10:20:08.742919Z","submitted_at":"2025-05-18T10:20:59Z","title":"SEED-GRPO: Semantic Entropy Enhanced GRPO for Uncertainty-Aware Policy Optimization","version":1},"cited_work":{"arxiv_id":"2505.12346","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.12346","snapshot_observed_at":"2026-07-04T13:49:52.427933Z","title":"arXiv preprint arXiv:2505.12346 , year=","venue":null,"work_id":"1a5aa60e-eb9c-41b1-968f-cfa8336af063","year":2025},"citing_paper":{"arxiv_id":"2606.04036","last_updated":"2026-06-02T02:31:13Z","snapshot_observed_at":"2026-08-05T09:50:41.075111Z","submitted_at":"2026-06-02T02:31:13Z","title":"Self-Distilled Policy Gradient","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-06-28T11:24:11.878439Z"},"links":{"cited_paper":"/paper/2505.12346","citing_paper":"/paper/2606.04036"},"observation_digest":"sha256:bd3d27f865d937056e38509cf25d3f40c5974611c09b6112733788bf0f3c112d","observation_id":"2383a679-d435-4953-9f81-f7ece23e5234","resolution":{"observed_at":"2026-07-02T01:56:27.906762Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.12346","last_updated":"2025-05-18T10:20:59Z","snapshot_observed_at":"2026-08-16T10:20:08.742919Z","submitted_at":"2025-05-18T10:20:59Z","title":"SEED-GRPO: Semantic Entropy Enhanced GRPO for Uncertainty-Aware Policy Optimization","version":1},"cited_work":{"arxiv_id":"2505.12346","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.12346","snapshot_observed_at":"2026-07-04T13:49:52.427933Z","title":"arXiv preprint arXiv:2505.12346 , year=","venue":null,"work_id":"1a5aa60e-eb9c-41b1-968f-cfa8336af063","year":2025},"citing_paper":{"arxiv_id":"2606.05152","last_updated":"2026-06-05T17:44:05Z","snapshot_observed_at":"2026-08-12T22:04:29.664198Z","submitted_at":"2026-06-03T17:54:04Z","title":"Reinforcement Learning from Rich Feedback with Distributional DAgger","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-06-28T06:44:56.667364Z"},"links":{"cited_paper":"/paper/2505.12346","citing_paper":"/paper/2606.05152"},"observation_digest":"sha256:14b76f1820625c065c1ab7640bcd953e511ccc2a60fe65b4559abd991c95bf34","observation_id":"d12d0f00-9328-4da1-be46-364c0af13427","resolution":{"observed_at":"2026-07-02T07:46:45.915273Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.12346","last_updated":"2025-05-18T10:20:59Z","snapshot_observed_at":"2026-08-16T10:20:08.742919Z","submitted_at":"2025-05-18T10:20:59Z","title":"SEED-GRPO: Semantic Entropy Enhanced GRPO for Uncertainty-Aware Policy Optimization","version":1},"cited_work":{"arxiv_id":"2505.12346","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.12346","snapshot_observed_at":"2026-07-04T13:49:52.427933Z","title":"arXiv preprint arXiv:2505.12346 , year=","venue":null,"work_id":"1a5aa60e-eb9c-41b1-968f-cfa8336af063","year":2025},"citing_paper":{"arxiv_id":"2606.08501","last_updated":"2026-06-07T07:59:55Z","snapshot_observed_at":"2026-08-16T13:14:06.969431Z","submitted_at":"2026-06-07T07:59:55Z","title":"Back on Track: Aligning Rewards and States for Reasoning in Diffusion Large Language Models","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-06-27T18:31:21.493677Z"},"links":{"cited_paper":"/paper/2505.12346","citing_paper":"/paper/2606.08501"},"observation_digest":"sha256:ed36bf84bc47b85f1e0f6096492dc397b2a86e7984d49cae3fd055e30e718730","observation_id":"d8439ce1-be73-4c88-a3ba-b2bbd9d8e9e5","resolution":{"observed_at":"2026-07-02T22:57:26.585403Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.12346","last_updated":"2025-05-18T10:20:59Z","snapshot_observed_at":"2026-08-16T10:20:08.742919Z","submitted_at":"2025-05-18T10:20:59Z","title":"SEED-GRPO: Semantic Entropy Enhanced GRPO for Uncertainty-Aware Policy Optimization","version":1},"cited_work":{"arxiv_id":"2505.12346","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.12346","snapshot_observed_at":"2026-07-04T13:49:52.427933Z","title":"arXiv preprint arXiv:2505.12346 , year=","venue":null,"work_id":"1a5aa60e-eb9c-41b1-968f-cfa8336af063","year":2025},"citing_paper":{"arxiv_id":"2606.11634","last_updated":"2026-06-10T03:56:03Z","snapshot_observed_at":"2026-08-12T13:36:16.324487Z","submitted_at":"2026-06-10T03:56:03Z","title":"Architecture-Aware Reinforcement Learning Makes Sliding-Window Attention Competitive in Math Reasoning","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-06-27T10:18:54.163862Z"},"links":{"cited_paper":"/paper/2505.12346","citing_paper":"/paper/2606.11634"},"observation_digest":"sha256:2f17e949718020a9f097fd0129cf6b261390569220ac22958d8ecc7ac8ab30a8","observation_id":"40290d98-3b46-434d-8d96-eb9c56da9001","resolution":{"observed_at":"2026-07-03T09:47:59.902366Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.12346","last_updated":"2025-05-18T10:20:59Z","snapshot_observed_at":"2026-08-16T10:20:08.742919Z","submitted_at":"2025-05-18T10:20:59Z","title":"SEED-GRPO: Semantic Entropy Enhanced GRPO for Uncertainty-Aware Policy Optimization","version":1},"cited_work":{"arxiv_id":"2505.12346","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.12346","snapshot_observed_at":"2026-07-04T13:49:52.427933Z","title":"arXiv preprint arXiv:2505.12346 , year=","venue":null,"work_id":"1a5aa60e-eb9c-41b1-968f-cfa8336af063","year":2025},"citing_paper":{"arxiv_id":"2606.20720","last_updated":"2026-06-16T17:24:32Z","snapshot_observed_at":"2026-08-11T12:11:38.598799Z","submitted_at":"2026-06-16T17:24:32Z","title":"Empowering Economic Simulation Through Situation-Aware Llm-Driven Generative System","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-06-26T21:43:01.949350Z"},"links":{"cited_paper":"/paper/2505.12346","citing_paper":"/paper/2606.20720"},"observation_digest":"sha256:bc819973659610ec079020be33839b981ae4f20b6047aaab7a119a3321026d16","observation_id":"eaa9e059-daff-422f-8897-f28c490542eb","resolution":{"observed_at":"2026-07-03T23:49:02.837064Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.12346","last_updated":"2025-05-18T10:20:59Z","snapshot_observed_at":"2026-08-16T10:20:08.742919Z","submitted_at":"2025-05-18T10:20:59Z","title":"SEED-GRPO: Semantic Entropy Enhanced GRPO for Uncertainty-Aware Policy Optimization","version":1},"cited_work":{"arxiv_id":"2505.12346","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.12346","snapshot_observed_at":"2026-07-04T13:49:52.427933Z","title":"arXiv preprint arXiv:2505.12346 , year=","venue":null,"work_id":"1a5aa60e-eb9c-41b1-968f-cfa8336af063","year":2025},"citing_paper":{"arxiv_id":"2606.22570","last_updated":"2026-06-21T16:14:46Z","snapshot_observed_at":"2026-08-05T07:45:25.638269Z","submitted_at":"2026-06-21T16:14:46Z","title":"What are Key Factors for Updates in RL for LLM Reasoning?","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-06-26T10:24:53.245739Z"},"links":{"cited_paper":"/paper/2505.12346","citing_paper":"/paper/2606.22570"},"observation_digest":"sha256:76b2a35059fce383b3dd1b2878e1b6ba017b2a34e339cf3a6b94a28b7d536f82","observation_id":"14275d2a-83f5-485b-b2f0-ea9c0e1c32d6","resolution":{"observed_at":"2026-07-04T09:09:43.560962Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.12346","last_updated":"2025-05-18T10:20:59Z","snapshot_observed_at":"2026-08-16T10:20:08.742919Z","submitted_at":"2025-05-18T10:20:59Z","title":"SEED-GRPO: Semantic Entropy Enhanced GRPO for Uncertainty-Aware Policy Optimization","version":1},"cited_work":{"arxiv_id":"2505.12346","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.12346","snapshot_observed_at":"2026-07-04T13:49:52.427933Z","title":"arXiv preprint arXiv:2505.12346 , year=","venue":null,"work_id":"1a5aa60e-eb9c-41b1-968f-cfa8336af063","year":2025},"citing_paper":{"arxiv_id":"2606.26917","last_updated":"2026-06-25T11:53:37Z","snapshot_observed_at":"2026-08-14T19:58:24.816006Z","submitted_at":"2026-06-25T11:53:37Z","title":"GEOALIGN: Geometric Rollout Curation for Robust LLM Reinforcement Learning","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-06-26T04:49:28.598430Z"},"links":{"cited_paper":"/paper/2505.12346","citing_paper":"/paper/2606.26917"},"observation_digest":"sha256:cf7eab1b220ab514a11e157384e8b9d8fff06108256f08c96e9bd89429a9ddcd","observation_id":"8829c247-63e7-43ce-b82f-14c140911edd","resolution":{"observed_at":"2026-07-04T13:49:52.429607Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.12346","last_updated":"2025-05-18T10:20:59Z","snapshot_observed_at":"2026-08-16T10:20:08.742919Z","submitted_at":"2025-05-18T10:20:59Z","title":"SEED-GRPO: Semantic Entropy Enhanced GRPO for Uncertainty-Aware Policy Optimization","version":1},"cited_work":{"arxiv_id":"2505.12346","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.12346","snapshot_observed_at":"2026-07-04T13:49:52.427933Z","title":"arXiv preprint arXiv:2505.12346 , year=","venue":null,"work_id":"1a5aa60e-eb9c-41b1-968f-cfa8336af063","year":2025},"citing_paper":{"arxiv_id":"2606.31575","last_updated":"2026-06-30T12:33:19Z","snapshot_observed_at":"2026-08-16T09:50:15.246017Z","submitted_at":"2026-06-30T12:33:19Z","title":"Which Tokens Matter? Adaptive Token Selection for RLVR with the Relative Surprisal Index","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-07-01T05:27:22.527220Z"},"links":{"cited_paper":"/paper/2505.12346","citing_paper":"/paper/2606.31575"},"observation_digest":"sha256:e95f604314526b27a2ee809cc246dadfe5e72d9928208e2797c5c8399f1c3050","observation_id":"00ded8ff-7d33-420b-a0fd-003270913020","resolution":{"observed_at":"2026-07-01T10:25:42.387378Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.12346","last_updated":"2025-05-18T10:20:59Z","snapshot_observed_at":"2026-08-16T10:20:08.742919Z","submitted_at":"2025-05-18T10:20:59Z","title":"SEED-GRPO: Semantic Entropy Enhanced GRPO for Uncertainty-Aware Policy Optimization","version":1},"cited_work":{"arxiv_id":"2505.12346","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.12346","snapshot_observed_at":"2026-07-04T13:49:52.427933Z","title":"arXiv preprint arXiv:2505.12346 , year=","venue":null,"work_id":"1a5aa60e-eb9c-41b1-968f-cfa8336af063","year":2025},"citing_paper":{"arxiv_id":"2606.32032","last_updated":"2026-06-30T17:56:01Z","snapshot_observed_at":"2026-07-07T00:05:41.920778Z","submitted_at":"2026-06-30T17:56:01Z","title":"Reinforcement Learning with Metacognitive Feedback Elicits Faithful Uncertainty Expression in LLMs","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-07-01T05:22:38.232552Z"},"links":{"cited_paper":"/paper/2505.12346","citing_paper":"/paper/2606.32032"},"observation_digest":"sha256:42f6dd613058479e1a03142a3170e079fc4c2519b296ed55b725930c48ec6f71","observation_id":"7c8263bc-0673-4a8f-83b1-d2cf75e97c99","resolution":{"observed_at":"2026-07-01T10:35:42.043252Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2505.12346/citation-record","integrity":"/paper/2505.12346/integrity","json":"/paper/2505.12346/citation-record.json","paper":"/paper/2505.12346"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-15T20:40:13.011959Z","title":"Deepseekmath: Pushing the limits of mathematical reasoning in open language models.arXiv preprint arXiv:2402.03300, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.12346","last_updated":"2025-05-18T10:20:59Z","snapshot_observed_at":"2026-08-16T10:20:08.742919Z","submitted_at":"2025-05-18T10:20:59Z","title":"SEED-GRPO: Semantic Entropy Enhanced GRPO for Uncertainty-Aware Policy Optimization","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-15T20:40:13.011959Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2505.12346"},"observation_digest":"sha256:5bfc997360f3eea6fb4a341603ee58f6c81e6d4f9026215e1619eecc28c0e35a","observation_id":"2ee99a11-40e6-45e4-bc87-f4d4f5fe37d7","resolution":{"observed_at":"2026-08-15T20:40:13.011959Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-08-15T12:33:55.451951Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-15T20:40:13.016281Z","title":"Deepseek-r1: Incentivizing reasoning capability in llms via reinforcement learning.arXiv preprint arXiv:2501.12948, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.12346","last_updated":"2025-05-18T10:20:59Z","snapshot_observed_at":"2026-08-16T10:20:08.742919Z","submitted_at":"2025-05-18T10:20:59Z","title":"SEED-GRPO: Semantic Entropy Enhanced GRPO for Uncertainty-Aware Policy Optimization","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-15T20:40:13.016281Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2505.12346"},"observation_digest":"sha256:48422a237c09c58e249220fd3d5257a2422ea58b3226b0be3fa7cfa13dbd6d3f","observation_id":"93197f6b-9e95-4cab-a620-cd82fcce7263","resolution":{"observed_at":"2026-08-15T20:40:13.016281Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20783","last_updated":"2025-10-06T09:30:03Z","snapshot_observed_at":"2026-08-13T12:34:54.476684Z","submitted_at":"2025-03-26T17:59:14Z","title":"Understanding R1-Zero-Like Training: A Critical Perspective","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.20783","snapshot_observed_at":"2026-08-15T20:40:13.020339Z","title":"Understanding r1-zero-like training: A critical perspective.arXiv preprint arXiv:2503.20783, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.12346","last_updated":"2025-05-18T10:20:59Z","snapshot_observed_at":"2026-08-16T10:20:08.742919Z","submitted_at":"2025-05-18T10:20:59Z","title":"SEED-GRPO: Semantic Entropy Enhanced GRPO for Uncertainty-Aware Policy Optimization","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-15T20:40:13.020339Z"},"links":{"cited_paper":"/paper/2503.20783","citing_paper":"/paper/2505.12346"},"observation_digest":"sha256:827bda4654ef1093f6eec2864c81e288234d67c12654f3c54af0256f8c1a2f1a","observation_id":"806637a3-f613-4a80-90d1-8ea4896e31ef","resolution":{"observed_at":"2026-08-15T20:40:13.020339Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-17T03:30:12.735656Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-15T20:40:13.024490Z","title":"Gpt-4 technical report.arXiv preprint arXiv:2303.08774, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.12346","last_updated":"2025-05-18T10:20:59Z","snapshot_observed_at":"2026-08-16T10:20:08.742919Z","submitted_at":"2025-05-18T10:20:59Z","title":"SEED-GRPO: Semantic Entropy Enhanced GRPO for Uncertainty-Aware Policy Optimization","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-15T20:40:13.024490Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2505.12346"},"observation_digest":"sha256:0d0e0cfae2a2bcc212f89346f684a8d6c325bb7f105bf0044e4510dee49af2f7","observation_id":"d72c7687-aa36-4f31-9f98-c9dde95e9424","resolution":{"observed_at":"2026-08-15T20:40:13.024490Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12599","last_updated":"2025-06-03T02:14:54Z","snapshot_observed_at":"2026-08-15T22:38:53.825110Z","submitted_at":"2025-01-22T02:48:14Z","title":"Kimi k1.5: Scaling Reinforcement Learning with LLMs","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12599","snapshot_observed_at":"2026-08-15T20:40:13.028343Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.12346","last_updated":"2025-05-18T10:20:59Z","snapshot_observed_at":"2026-08-16T10:20:08.742919Z","submitted_at":"2025-05-18T10:20:59Z","title":"SEED-GRPO: Semantic Entropy Enhanced GRPO for Uncertainty-Aware Policy Optimization","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-15T20:40:13.028343Z"},"links":{"cited_paper":"/paper/2501.12599","citing_paper":"/paper/2505.12346"},"observation_digest":"sha256:94bb8907514a439d36dd92b4d9c9c5340d8ef3ace026bc9f63495e058ba5e96b","observation_id":"060360f2-1a43-4706-b4f0-d4dbcd2858d1","resolution":{"observed_at":"2026-08-15T20:40:13.028343Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.05812","last_updated":"2025-05-18T13:41:33Z","snapshot_observed_at":"2026-08-16T12:43:05.556743Z","submitted_at":"2025-04-08T08:48:51Z","title":"Right Question is Already Half the Answer: Fully Unsupervised LLM Reasoning Incentivization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.05812","snapshot_observed_at":"2026-08-15T20:40:13.032436Z","title":"Right question is already half the answer: Fully unsupervised llm reasoning incentivization.arXiv preprint arXiv:2504.05812, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.12346","last_updated":"2025-05-18T10:20:59Z","snapshot_observed_at":"2026-08-16T10:20:08.742919Z","submitted_at":"2025-05-18T10:20:59Z","title":"SEED-GRPO: Semantic Entropy Enhanced GRPO for Uncertainty-Aware Policy Optimization","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-15T20:40:13.032436Z"},"links":{"cited_paper":"/paper/2504.05812","citing_paper":"/paper/2505.12346"},"observation_digest":"sha256:c9581be511ff5584d310478ee028ed2d177055e795fcba0c953a9acb7ef3fc0f","observation_id":"2502b848-428b-4b18-bfe3-feaa41f62102","resolution":{"observed_at":"2026-08-15T20:40:13.032436Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:40:13.036887Z","title":"Cppo: Accelerating the training of group relative policy optimization-based reasoning models.arXiv preprint arXiv:2503.22342, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.12346","last_updated":"2025-05-18T10:20:59Z","snapshot_observed_at":"2026-08-16T10:20:08.742919Z","submitted_at":"2025-05-18T10:20:59Z","title":"SEED-GRPO: Semantic Entropy Enhanced GRPO for Uncertainty-Aware Policy Optimization","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-15T20:40:13.036887Z"},"links":{"citing_paper":"/paper/2505.12346"},"observation_digest":"sha256:bcfb60e788978bc7f0566b514729cb8853300f7eb1d6ab2aef38131287f24feb","observation_id":"f557445a-6657-4e71-8261-a5188b2cbcd7","resolution":{"observed_at":"2026-08-15T20:40:13.036887Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.11343","last_updated":"2025-06-12T06:03:24Z","snapshot_observed_at":"2026-08-16T12:40:48.744732Z","submitted_at":"2025-04-15T16:15:02Z","title":"A Minimalist Approach to LLM Reasoning: from Rejection Sampling to Reinforce","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.11343","snapshot_observed_at":"2026-08-15T20:40:13.040337Z","title":"A minimalist approach to llm reasoning: from rejection sampling to reinforce.arXiv preprint arXiv:2504.11343, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.12346","last_updated":"2025-05-18T10:20:59Z","snapshot_observed_at":"2026-08-16T10:20:08.742919Z","submitted_at":"2025-05-18T10:20:59Z","title":"SEED-GRPO: Semantic Entropy Enhanced GRPO for Uncertainty-Aware Policy Optimization","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-15T20:40:13.040337Z"},"links":{"cited_paper":"/paper/2504.11343","citing_paper":"/paper/2505.12346"},"observation_digest":"sha256:a697cec7d64490e18e506e7bf8d8ec40296269ebdfdd6b2d9dca2a73ca6769b4","observation_id":"7825dc23-4a1e-4b4f-85c6-2153f653c563","resolution":{"observed_at":"2026-08-15T20:40:13.040337Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.05118","last_updated":"2025-04-11T02:54:58Z","snapshot_observed_at":"2026-08-14T16:01:52.772456Z","submitted_at":"2025-04-07T14:21:11Z","title":"VAPO: Efficient and Reliable Reinforcement Learning for Advanced Reasoning Tasks","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.05118","snapshot_observed_at":"2026-08-15T20:40:13.044129Z","title":"Vapo: Efficient and reliable reinforcement learning for advanced reasoning tasks.arXiv preprint arXiv:2504.05118, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.12346","last_updated":"2025-05-18T10:20:59Z","snapshot_observed_at":"2026-08-16T10:20:08.742919Z","submitted_at":"2025-05-18T10:20:59Z","title":"SEED-GRPO: Semantic Entropy Enhanced GRPO for Uncertainty-Aware Policy Optimization","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-15T20:40:13.044129Z"},"links":{"cited_paper":"/paper/2504.05118","citing_paper":"/paper/2505.12346"},"observation_digest":"sha256:bda0923ac5ce6c0fa69ced1ceb975e1fc779e79d4a4563912a8766076b1beffc","observation_id":"788c11cf-4a69-464b-a656-4f9e647dda6b","resolution":{"observed_at":"2026-08-15T20:40:13.044129Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.24290","last_updated":"2025-07-05T09:01:04Z","snapshot_observed_at":"2026-08-12T18:49:18.486177Z","submitted_at":"2025-03-31T16:36:05Z","title":"Open-Reasoner-Zero: An Open Source Approach to Scaling Up Reinforcement Learning on the Base Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.24290","snapshot_observed_at":"2026-08-15T20:40:13.047975Z","title":"Open-reasoner-zero: An open source approach to scaling up reinforcement learning on the base model.arXiv preprint arXiv:2503.24290, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.12346","last_updated":"2025-05-18T10:20:59Z","snapshot_observed_at":"2026-08-16T10:20:08.742919Z","submitted_at":"2025-05-18T10:20:59Z","title":"SEED-GRPO: Semantic Entropy Enhanced GRPO for Uncertainty-Aware Policy Optimization","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-15T20:40:13.047975Z"},"links":{"cited_paper":"/paper/2503.24290","citing_paper":"/paper/2505.12346"},"observation_digest":"sha256:327155b1cf4e8dc903883a8b6facdcf87fcef55507756df81f4f6d84e78eb053","observation_id":"2c595027-37fa-465e-83eb-0a25c13f14b6","resolution":{"observed_at":"2026-08-15T20:40:13.047975Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.13818","last_updated":"2026-04-22T00:26:08Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-18T17:49:55Z","title":"Not All Rollouts are Useful: Down-Sampling Rollouts in LLM Reinforcement Learning","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.13818","snapshot_observed_at":"2026-08-15T20:40:13.051993Z","title":"Not all rollouts are useful: Down- sampling rollouts in llm reinforcement learning.arXiv preprint arXiv:2504.13818, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.12346","last_updated":"2025-05-18T10:20:59Z","snapshot_observed_at":"2026-08-16T10:20:08.742919Z","submitted_at":"2025-05-18T10:20:59Z","title":"SEED-GRPO: Semantic Entropy Enhanced GRPO for Uncertainty-Aware Policy Optimization","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-15T20:40:13.051993Z"},"links":{"cited_paper":"/paper/2504.13818","citing_paper":"/paper/2505.12346"},"observation_digest":"sha256:4fdfa4564a9ef55abd6b065dae9c456fdcacd2be9334469e55c4ca4cb4a0ca65","observation_id":"8f197b82-6299-4f5e-ba2f-a2d960eaec36","resolution":{"observed_at":"2026-08-15T20:40:13.051993Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16720","last_updated":"2026-04-30T02:46:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-21T18:04:31Z","title":"OpenAI o1 System Card","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.16720","snapshot_observed_at":"2026-08-15T20:40:13.056166Z","title":"Openai o1 system card.arXiv preprint arXiv:2412.16720, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.12346","last_updated":"2025-05-18T10:20:59Z","snapshot_observed_at":"2026-08-16T10:20:08.742919Z","submitted_at":"2025-05-18T10:20:59Z","title":"SEED-GRPO: Semantic Entropy Enhanced GRPO for Uncertainty-Aware Policy Optimization","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-15T20:40:13.056166Z"},"links":{"cited_paper":"/paper/2412.16720","citing_paper":"/paper/2505.12346"},"observation_digest":"sha256:b23e6a6d52ad70ce6f1194feddb26a34641bcfd62d6123619c88654a3bfec116","observation_id":"3e992d9d-dbcf-4ad6-ae0e-c713228e4c24","resolution":{"observed_at":"2026-08-15T20:40:13.056166Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11805","last_updated":"2025-05-09T21:04:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-19T02:39:27Z","title":"Gemini: A Family of Highly Capable Multimodal Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.11805","snapshot_observed_at":"2026-08-15T20:40:13.059812Z","title":"Gemini: A family of highly capable multimodal models.arXiv preprint arXiv:2312.11805, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.12346","last_updated":"2025-05-18T10:20:59Z","snapshot_observed_at":"2026-08-16T10:20:08.742919Z","submitted_at":"2025-05-18T10:20:59Z","title":"SEED-GRPO: Semantic Entropy Enhanced GRPO for Uncertainty-Aware Policy Optimization","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-15T20:40:13.059812Z"},"links":{"cited_paper":"/paper/2312.11805","citing_paper":"/paper/2505.12346"},"observation_digest":"sha256:92acf07d4831961874ef7bf5e3bc7652cc5f4348c36a36677bd1a15a1645a4a6","observation_id":"d74b4e0c-42e0-49e2-a291-df256a281dc7","resolution":{"observed_at":"2026-08-15T20:40:13.059812Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:40:13.844034Z","title":"The claude 3 model family: Opus, sonnet, haiku","venue":null,"work_id":"6a7be027-ea84-4763-b7e4-f10f72aaf611","year":2024},"citing_paper":{"arxiv_id":"2505.12346","last_updated":"2025-05-18T10:20:59Z","snapshot_observed_at":"2026-08-16T10:20:08.742919Z","submitted_at":"2025-05-18T10:20:59Z","title":"SEED-GRPO: Semantic Entropy Enhanced GRPO for Uncertainty-Aware Policy Optimization","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-15T20:40:13.063624Z"},"links":{"citing_paper":"/paper/2505.12346"},"observation_digest":"sha256:0021fa2913c8e19b28d8ba45abd8cb5c65c7258d4849d377eed50e18629454dd","observation_id":"26c306b2-9fc6-4406-96a2-3acc9fc7fdf8","resolution":{"observed_at":"2026-08-15T20:40:13.847921Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.04434","last_updated":"2024-06-19T06:04:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-07T15:56:43Z","title":"DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.04434","snapshot_observed_at":"2026-08-15T20:40:13.067375Z","title":"Deepseek-v2: A strong, economical, and efficient mixture-of-experts language model.arXiv preprint arXiv:2405.04434, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.12346","last_updated":"2025-05-18T10:20:59Z","snapshot_observed_at":"2026-08-16T10:20:08.742919Z","submitted_at":"2025-05-18T10:20:59Z","title":"SEED-GRPO: Semantic Entropy Enhanced GRPO for Uncertainty-Aware Policy Optimization","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-15T20:40:13.067375Z"},"links":{"cited_paper":"/paper/2405.04434","citing_paper":"/paper/2505.12346"},"observation_digest":"sha256:f943c01218c1af2b9547945e456a8b81651e40f0380813da3cac2bf103887b0f","observation_id":"5677145c-b958-48a5-8a0f-6cfe2a052da7","resolution":{"observed_at":"2026-08-15T20:40:13.067375Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14476","last_updated":"2025-05-20T01:37:34Z","snapshot_observed_at":"2026-08-02T01:40:54.187278Z","submitted_at":"2025-03-18T17:49:06Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.14476","snapshot_observed_at":"2026-08-15T20:40:13.071250Z","title":"Dapo: An open-source llm reinforcement learning system at scale.arXiv preprint arXiv:2503.14476, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.12346","last_updated":"2025-05-18T10:20:59Z","snapshot_observed_at":"2026-08-16T10:20:08.742919Z","submitted_at":"2025-05-18T10:20:59Z","title":"SEED-GRPO: Semantic Entropy Enhanced GRPO for Uncertainty-Aware Policy Optimization","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-15T20:40:13.071250Z"},"links":{"cited_paper":"/paper/2503.14476","citing_paper":"/paper/2505.12346"},"observation_digest":"sha256:3126fa019472677d70ffd90f0ef3540cd8424548c03a54a8eb57d36d97e3b8d4","observation_id":"17b33c8d-64ff-47c5-883b-a9402670cbb0","resolution":{"observed_at":"2026-08-15T20:40:13.071250Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:40:13.074768Z","title":"Gpg: A simple and strong reinforcement learning baseline for model reasoning.arXiv preprint arXiv:2504.02546, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.12346","last_updated":"2025-05-18T10:20:59Z","snapshot_observed_at":"2026-08-16T10:20:08.742919Z","submitted_at":"2025-05-18T10:20:59Z","title":"SEED-GRPO: Semantic Entropy Enhanced GRPO for Uncertainty-Aware Policy Optimization","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-15T20:40:13.074768Z"},"links":{"citing_paper":"/paper/2505.12346"},"observation_digest":"sha256:1ed1f6d999be22fb159a4539714baeae3eb73e8a3b644764f34e028e2e01a767","observation_id":"c9ac5c6f-f0bf-4be6-8bb9-114314a10633","resolution":{"observed_at":"2026-08-15T20:40:13.074768Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:40:13.078247Z","title":"Grpo-lead: A difficulty-aware reinforcement learn- ing approach for concise mathematical reasoning in language models.arXiv preprint arXiv:2504.09696, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.12346","last_updated":"2025-05-18T10:20:59Z","snapshot_observed_at":"2026-08-16T10:20:08.742919Z","submitted_at":"2025-05-18T10:20:59Z","title":"SEED-GRPO: Semantic Entropy Enhanced GRPO for Uncertainty-Aware Policy Optimization","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-15T20:40:13.078247Z"},"links":{"citing_paper":"/paper/2505.12346"},"observation_digest":"sha256:bc267723c575dbe44ee56d0c1c99d077d6bb78446b8ef5e52e59f2f499341151","observation_id":"4d41709b-58e5-4e78-9b78-03a7a7b7d1a2","resolution":{"observed_at":"2026-08-15T20:40:13.078247Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.14286","last_updated":"2025-04-22T10:07:13Z","snapshot_observed_at":"2026-08-16T11:50:07.755604Z","submitted_at":"2025-04-19T13:06:03Z","title":"SRPO: A Cross-Domain Implementation of Large-Scale Reinforcement Learning on LLM","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.14286","snapshot_observed_at":"2026-08-15T20:40:13.081592Z","title":"Srpo: A cross-domain imple- mentation of large-scale reinforcement learning on llm.arXiv preprint arXiv:2504.14286, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.12346","last_updated":"2025-05-18T10:20:59Z","snapshot_observed_at":"2026-08-16T10:20:08.742919Z","submitted_at":"2025-05-18T10:20:59Z","title":"SEED-GRPO: Semantic Entropy Enhanced GRPO for Uncertainty-Aware Policy Optimization","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-15T20:40:13.081592Z"},"links":{"cited_paper":"/paper/2504.14286","citing_paper":"/paper/2505.12346"},"observation_digest":"sha256:abfff50a36b5d1a4c608e73252db92c793b08888d24bd765832fb8dc82f718eb","observation_id":"e58237ea-71b5-4bb8-b946-dbe383eb6477","resolution":{"observed_at":"2026-08-15T20:40:13.081592Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:40:13.085686Z","title":"Detecting hallucinations in large language models using semantic entropy.Nature, 630(8017):625–630, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.12346","last_updated":"2025-05-18T10:20:59Z","snapshot_observed_at":"2026-08-16T10:20:08.742919Z","submitted_at":"2025-05-18T10:20:59Z","title":"SEED-GRPO: Semantic Entropy Enhanced GRPO for Uncertainty-Aware Policy Optimization","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-15T20:40:13.085686Z"},"links":{"citing_paper":"/paper/2505.12346"},"observation_digest":"sha256:7bdae73e5ba7c73a3eff39dea3cdb3637409a871c47b613cc2048768425aea5d","observation_id":"411aa082-0154-4bea-993d-b0c547b36a80","resolution":{"observed_at":"2026-08-15T20:40:13.085686Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:40:13.825434Z","title":"Chi, Sharan Narang, Aakanksha Chowdhery, and Denny Zhou","venue":null,"work_id":"1369ea25-068d-429a-bb3a-dfe19c4b198a","year":2023},"citing_paper":{"arxiv_id":"2505.12346","last_updated":"2025-05-18T10:20:59Z","snapshot_observed_at":"2026-08-16T10:20:08.742919Z","submitted_at":"2025-05-18T10:20:59Z","title":"SEED-GRPO: Semantic Entropy Enhanced GRPO for Uncertainty-Aware Policy Optimization","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-15T20:40:13.089360Z"},"links":{"citing_paper":"/paper/2505.12346"},"observation_digest":"sha256:d660f76ad68eaba159b9175e608f1ace934e752559c9b73c4254f6686f627968","observation_id":"9da99666-9fcb-4d92-a774-359878e57ad3","resolution":{"observed_at":"2026-08-15T20:40:13.829638Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:40:13.813180Z","title":"Griffiths, Yuan Cao, and Karthik R Narasimhan","venue":null,"work_id":"edbb317e-1064-4a2f-9d08-61c209831f89","year":2023},"citing_paper":{"arxiv_id":"2505.12346","last_updated":"2025-05-18T10:20:59Z","snapshot_observed_at":"2026-08-16T10:20:08.742919Z","submitted_at":"2025-05-18T10:20:59Z","title":"SEED-GRPO: Semantic Entropy Enhanced GRPO for Uncertainty-Aware Policy Optimization","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-15T20:40:13.092868Z"},"links":{"citing_paper":"/paper/2505.12346"},"observation_digest":"sha256:7b4a096f7ae6648cc9fe615d72decfb9ff0496c7025ebc78bc1789a8230392a9","observation_id":"62ca4571-c604-40a6-98ad-08bf2d5c3b01","resolution":{"observed_at":"2026-08-15T20:40:13.817290Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:40:13.801178Z","title":"Semantic uncertainty: Linguistic invariances for uncertainty estimation in natural language generation","venue":null,"work_id":"4812a3ca-d2d6-4349-8607-8abb70eae3bf","year":2023},"citing_paper":{"arxiv_id":"2505.12346","last_updated":"2025-05-18T10:20:59Z","snapshot_observed_at":"2026-08-16T10:20:08.742919Z","submitted_at":"2025-05-18T10:20:59Z","title":"SEED-GRPO: Semantic Entropy Enhanced GRPO for Uncertainty-Aware Policy Optimization","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-15T20:40:13.096326Z"},"links":{"citing_paper":"/paper/2505.12346"},"observation_digest":"sha256:6576d60110a253c6e538162fedabdff30d438bcddb4caa2b0c0dbcb303b9482c","observation_id":"4de2cb60-2685-4eb1-94b8-529d495a03cc","resolution":{"observed_at":"2026-08-15T20:40:13.805391Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.15927","last_updated":"2024-06-22T19:46:06Z","snapshot_observed_at":"2026-07-30T04:59:24.269176Z","submitted_at":"2024-06-22T19:46:06Z","title":"Semantic Entropy Probes: Robust and Cheap Hallucination Detection in LLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.15927","snapshot_observed_at":"2026-08-15T20:40:13.099891Z","title":"Semantic entropy probes: Robust and cheap hallucination detection in llms.arXiv preprint arXiv:2406.15927, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.12346","last_updated":"2025-05-18T10:20:59Z","snapshot_observed_at":"2026-08-16T10:20:08.742919Z","submitted_at":"2025-05-18T10:20:59Z","title":"SEED-GRPO: Semantic Entropy Enhanced GRPO for Uncertainty-Aware Policy Optimization","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-15T20:40:13.099891Z"},"links":{"cited_paper":"/paper/2406.15927","citing_paper":"/paper/2505.12346"},"observation_digest":"sha256:b9427d18833ee37c2b65d2bac2657c5d06535f8d3bf97d56366f4e262e04e39e","observation_id":"fe917928-6605-40af-9bea-2bc25baec380","resolution":{"observed_at":"2026-08-15T20:40:13.099891Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:40:13.103957Z","title":"Curriculum learning","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2505.12346","last_updated":"2025-05-18T10:20:59Z","snapshot_observed_at":"2026-08-16T10:20:08.742919Z","submitted_at":"2025-05-18T10:20:59Z","title":"SEED-GRPO: Semantic Entropy Enhanced GRPO for Uncertainty-Aware Policy Optimization","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-15T20:40:13.103957Z"},"links":{"citing_paper":"/paper/2505.12346"},"observation_digest":"sha256:91c4d7945a3f48a772dab93d4595102321b67281787a6ba45cba62f73cf3c4bb","observation_id":"1cb3a471-1774-4bd8-968a-38b86e82858b","resolution":{"observed_at":"2026-08-15T20:40:13.103957Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:40:13.107434Z","title":"A mathematical theory of communication.The Bell system technical journal, 27(3):379–423, 1948","venue":null,"work_id":null,"year":1948},"citing_paper":{"arxiv_id":"2505.12346","last_updated":"2025-05-18T10:20:59Z","snapshot_observed_at":"2026-08-16T10:20:08.742919Z","submitted_at":"2025-05-18T10:20:59Z","title":"SEED-GRPO: Semantic Entropy Enhanced GRPO for Uncertainty-Aware Policy Optimization","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-15T20:40:13.107434Z"},"links":{"citing_paper":"/paper/2505.12346"},"observation_digest":"sha256:513f35ebd00800d37c207881bf7d7d7fc657dfbcc25949c1d41a34a942982c97","observation_id":"656e5340-d350-417b-b530-0b29a7b9794d","resolution":{"observed_at":"2026-08-15T20:40:13.107434Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:40:13.111000Z","title":"Chain-of-thought prompting elicits reasoning in large language models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.12346","last_updated":"2025-05-18T10:20:59Z","snapshot_observed_at":"2026-08-16T10:20:08.742919Z","submitted_at":"2025-05-18T10:20:59Z","title":"SEED-GRPO: Semantic Entropy Enhanced GRPO for Uncertainty-Aware Policy Optimization","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-15T20:40:13.111000Z"},"links":{"citing_paper":"/paper/2505.12346"},"observation_digest":"sha256:cdd3fcd51cc8d90d4697038cbfbb8181e937a358a2eaefa613a701ec04a82226","observation_id":"0597bbb4-e21c-4d68-a9f7-20826ecbbe40","resolution":{"observed_at":"2026-08-15T20:40:13.111000Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.03387","last_updated":"2025-07-29T16:23:02Z","snapshot_observed_at":"2026-08-08T04:13:22.884923Z","submitted_at":"2025-02-05T17:23:45Z","title":"LIMO: Less is More for Reasoning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.03387","snapshot_observed_at":"2026-08-15T20:40:13.115113Z","title":"Limo: Less is more for reasoning.arXiv preprint arXiv:2502.03387, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.12346","last_updated":"2025-05-18T10:20:59Z","snapshot_observed_at":"2026-08-16T10:20:08.742919Z","submitted_at":"2025-05-18T10:20:59Z","title":"SEED-GRPO: Semantic Entropy Enhanced GRPO for Uncertainty-Aware Policy Optimization","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-15T20:40:13.115113Z"},"links":{"cited_paper":"/paper/2502.03387","citing_paper":"/paper/2505.12346"},"observation_digest":"sha256:c8f595cf8df472f16f6a2b54676cffb21042665783fd208c8b2c339ca5a1f415","observation_id":"76b47959-eda1-4b51-91e6-1a27791f76c6","resolution":{"observed_at":"2026-08-15T20:40:13.115113Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:40:13.767863Z","title":"ReST- MCTS*: LLM self-training via process reward guided tree search","venue":null,"work_id":"61aa5550-7b4d-4b3b-a41a-e8f1cd04c032","year":2024},"citing_paper":{"arxiv_id":"2505.12346","last_updated":"2025-05-18T10:20:59Z","snapshot_observed_at":"2026-08-16T10:20:08.742919Z","submitted_at":"2025-05-18T10:20:59Z","title":"SEED-GRPO: Semantic Entropy Enhanced GRPO for Uncertainty-Aware Policy Optimization","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-15T20:40:13.118997Z"},"links":{"citing_paper":"/paper/2505.12346"},"observation_digest":"sha256:986c5c21556a7f39b6626a379d1001df4e786c1748c16555c9f00ecbf810be66","observation_id":"80079864-e5b5-42e5-8828-cfe4073c139c","resolution":{"observed_at":"2026-08-15T20:40:13.771843Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-08-15T20:26:32.102285Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-15T20:40:13.122315Z","title":"Proximal policy optimization algorithms.arXiv preprint arXiv:1707.06347, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.12346","last_updated":"2025-05-18T10:20:59Z","snapshot_observed_at":"2026-08-16T10:20:08.742919Z","submitted_at":"2025-05-18T10:20:59Z","title":"SEED-GRPO: Semantic Entropy Enhanced GRPO for Uncertainty-Aware Policy Optimization","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-15T20:40:13.122315Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2505.12346"},"observation_digest":"sha256:b6794a1da91ef9cb352de42db8ddcf503429f736a6409b6161199f1dc4250cb9","observation_id":"be79bc08-9e40-47b3-818d-42df74bdf59f","resolution":{"observed_at":"2026-08-15T20:40:13.122315Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:40:13.125943Z","title":"Open r1: A fully open reproduction of deepseek-r1, January 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.12346","last_updated":"2025-05-18T10:20:59Z","snapshot_observed_at":"2026-08-16T10:20:08.742919Z","submitted_at":"2025-05-18T10:20:59Z","title":"SEED-GRPO: Semantic Entropy Enhanced GRPO for Uncertainty-Aware Policy Optimization","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-15T20:40:13.125943Z"},"links":{"citing_paper":"/paper/2505.12346"},"observation_digest":"sha256:e8e22b0ed6f667dec874187df980df097b3d513bb732e95bcc77ace97cfe8afb","observation_id":"53cb17cb-c18c-4078-8e31-ddab9477267e","resolution":{"observed_at":"2026-08-15T20:40:13.125943Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:40:13.748029Z","title":"Measuring mathematical problem solving with the MATH dataset","venue":null,"work_id":"784028a7-59e2-4efb-85da-23161fc98af2","year":2021},"citing_paper":{"arxiv_id":"2505.12346","last_updated":"2025-05-18T10:20:59Z","snapshot_observed_at":"2026-08-16T10:20:08.742919Z","submitted_at":"2025-05-18T10:20:59Z","title":"SEED-GRPO: Semantic Entropy Enhanced GRPO for Uncertainty-Aware Policy Optimization","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-15T20:40:13.129548Z"},"links":{"citing_paper":"/paper/2505.12346"},"observation_digest":"sha256:8a394f519a8733d0896271e0575c2b3a308989dbd0fa56f5604b99c9690fbb78","observation_id":"3cc60ea2-ddc0-474e-9acc-a62709c82019","resolution":{"observed_at":"2026-08-15T20:40:13.751927Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:40:13.736502Z","title":"Solving quantitative reasoning problems with language models","venue":null,"work_id":"cceb3905-ce23-4b9f-9ff4-82a64977d958","year":2022},"citing_paper":{"arxiv_id":"2505.12346","last_updated":"2025-05-18T10:20:59Z","snapshot_observed_at":"2026-08-16T10:20:08.742919Z","submitted_at":"2025-05-18T10:20:59Z","title":"SEED-GRPO: Semantic Entropy Enhanced GRPO for Uncertainty-Aware Policy Optimization","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-15T20:40:13.132960Z"},"links":{"citing_paper":"/paper/2505.12346"},"observation_digest":"sha256:c5adf070934bc2b6dc005d410858ff530edea4f423a959c3fdc4f3e818958ac2","observation_id":"80a5c625-2dd1-43d7-bb23-158363ec38c9","resolution":{"observed_at":"2026-08-15T20:40:13.740603Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:40:13.722218Z","title":"Olympicarena: Benchmarking multi-discipline cognitive reasoning for superintelligent AI","venue":null,"work_id":"5d4726b2-f5a9-44f3-9c2e-002762e77a1b","year":2024},"citing_paper":{"arxiv_id":"2505.12346","last_updated":"2025-05-18T10:20:59Z","snapshot_observed_at":"2026-08-16T10:20:08.742919Z","submitted_at":"2025-05-18T10:20:59Z","title":"SEED-GRPO: Semantic Entropy Enhanced GRPO for Uncertainty-Aware Policy Optimization","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-15T20:40:13.136266Z"},"links":{"citing_paper":"/paper/2505.12346"},"observation_digest":"sha256:dbb3f4b772305bc6a67a4574e197152614c39c0d5900e67cd1ec54043749a8df","observation_id":"3c608ec6-defa-464d-9b97-74487315f1df","resolution":{"observed_at":"2026-08-15T20:40:13.728314Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12122","last_updated":"2024-09-18T16:45:37Z","snapshot_observed_at":"2026-08-14T16:00:41.902820Z","submitted_at":"2024-09-18T16:45:37Z","title":"Qwen2.5-Math Technical Report: Toward Mathematical Expert Model via Self-Improvement","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12122","snapshot_observed_at":"2026-08-15T20:40:13.139709Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.12346","last_updated":"2025-05-18T10:20:59Z","snapshot_observed_at":"2026-08-16T10:20:08.742919Z","submitted_at":"2025-05-18T10:20:59Z","title":"SEED-GRPO: Semantic Entropy Enhanced GRPO for Uncertainty-Aware Policy Optimization","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-15T20:40:13.139709Z"},"links":{"cited_paper":"/paper/2409.12122","citing_paper":"/paper/2505.12346"},"observation_digest":"sha256:8e37edd4a092c18464822cf87bd791b1244422a0eec8f5dfc68b18857cf8ce4c","observation_id":"ae2d74c8-0d7e-42d9-83b0-244a2a88dffc","resolution":{"observed_at":"2026-08-15T20:40:13.139709Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.18892","last_updated":"2025-08-06T08:42:32Z","snapshot_observed_at":"2026-07-06T20:57:57.039376Z","submitted_at":"2025-03-24T17:06:10Z","title":"SimpleRL-Zoo: Investigating and Taming Zero Reinforcement Learning for Open Base Models in the Wild","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.18892","snapshot_observed_at":"2026-08-15T20:40:13.143452Z","title":"Simplerl-zoo: Investigating and taming zero reinforcement learning for open base models in the wild.arXiv preprint arXiv:2503.18892, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.12346","last_updated":"2025-05-18T10:20:59Z","snapshot_observed_at":"2026-08-16T10:20:08.742919Z","submitted_at":"2025-05-18T10:20:59Z","title":"SEED-GRPO: Semantic Entropy Enhanced GRPO for Uncertainty-Aware Policy Optimization","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-15T20:40:13.143452Z"},"links":{"cited_paper":"/paper/2503.18892","citing_paper":"/paper/2505.12346"},"observation_digest":"sha256:30bff222404d72b1aef1731859f851a5407f2d1f2718006b11afd3f97a2fdc5c","observation_id":"879da7f4-6451-4c9d-8d98-f5e0fac47948","resolution":{"observed_at":"2026-08-15T20:40:13.143452Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.02078","last_updated":"2024-04-02T16:25:30Z","snapshot_observed_at":"2026-08-17T00:42:04.970772Z","submitted_at":"2024-04-02T16:25:30Z","title":"Advancing LLM Reasoning Generalists with Preference Trees","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.02078","snapshot_observed_at":"2026-08-15T20:40:13.147339Z","title":"Advancing llm reasoning generalists with preference trees.arXiv preprint arXiv:2404.02078, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.12346","last_updated":"2025-05-18T10:20:59Z","snapshot_observed_at":"2026-08-16T10:20:08.742919Z","submitted_at":"2025-05-18T10:20:59Z","title":"SEED-GRPO: Semantic Entropy Enhanced GRPO for Uncertainty-Aware Policy Optimization","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-15T20:40:13.147339Z"},"links":{"cited_paper":"/paper/2404.02078","citing_paper":"/paper/2505.12346"},"observation_digest":"sha256:8e8b86ec1d0ec8f65ef09233ed83d7fd9eddb772527665be8cbe14dfb3c59a69","observation_id":"f2527d3e-6789-464e-b0c6-c7f67fa7a817","resolution":{"observed_at":"2026-08-15T20:40:13.147339Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15115","snapshot_observed_at":"2026-08-15T20:40:13.151066Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.12346","last_updated":"2025-05-18T10:20:59Z","snapshot_observed_at":"2026-08-16T10:20:08.742919Z","submitted_at":"2025-05-18T10:20:59Z","title":"SEED-GRPO: Semantic Entropy Enhanced GRPO for Uncertainty-Aware Policy Optimization","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-15T20:40:13.151066Z"},"links":{"cited_paper":"/paper/2412.15115","citing_paper":"/paper/2505.12346"},"observation_digest":"sha256:93b3a06fcfed91c464eeb44166aa367ef53861415e89004775dbbbccbdca9698","observation_id":"e18e2a4c-53a7-4fbb-91f4-f5ad7d9d0b9e","resolution":{"observed_at":"2026-08-15T20:40:13.151066Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2107.03374","last_updated":"2021-07-14T17:16:02Z","snapshot_observed_at":"2026-08-08T11:58:24.516369Z","submitted_at":"2021-07-07T17:41:24Z","title":"Evaluating Large Language Models Trained on Code","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2107.03374","snapshot_observed_at":"2026-08-15T20:40:13.154555Z","title":"Evaluating large language models trained on code.arXiv preprint arXiv:2107.03374, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.12346","last_updated":"2025-05-18T10:20:59Z","snapshot_observed_at":"2026-08-16T10:20:08.742919Z","submitted_at":"2025-05-18T10:20:59Z","title":"SEED-GRPO: Semantic Entropy Enhanced GRPO for Uncertainty-Aware Policy Optimization","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-15T20:40:13.154555Z"},"links":{"cited_paper":"/paper/2107.03374","citing_paper":"/paper/2505.12346"},"observation_digest":"sha256:5e934856e177f47cd47c74fa2638e454dd83e191c26144d269c53b190dd7471e","observation_id":"00c90c4c-6483-41a1-bd50-b4ab1ce0c251","resolution":{"observed_at":"2026-08-15T20:40:13.154555Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1907.11692","last_updated":"2019-07-26T17:48:29Z","snapshot_observed_at":"2026-08-16T14:33:50.657682Z","submitted_at":"2019-07-26T17:48:29Z","title":"RoBERTa: A Robustly Optimized BERT Pretraining Approach","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1907.11692","snapshot_observed_at":"2026-08-15T20:40:13.157996Z","title":"Roberta: A robustly optimized bert pretraining approach.arXiv preprint arXiv:1907.11692, 2019","venue":null,"work_id":null,"year":1907},"citing_paper":{"arxiv_id":"2505.12346","last_updated":"2025-05-18T10:20:59Z","snapshot_observed_at":"2026-08-16T10:20:08.742919Z","submitted_at":"2025-05-18T10:20:59Z","title":"SEED-GRPO: Semantic Entropy Enhanced GRPO for Uncertainty-Aware Policy Optimization","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-15T20:40:13.157996Z"},"links":{"cited_paper":"/paper/1907.11692","citing_paper":"/paper/2505.12346"},"observation_digest":"sha256:e310766a79e70226d332e0cdb0b121964be7968c1719c9cb55cc86da60978845","observation_id":"ee56f8a5-890a-45f2-9dae-01ef05def261","resolution":{"observed_at":"2026-08-15T20:40:13.157996Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1908.10084","last_updated":"2019-08-27T08:50:17Z","snapshot_observed_at":"2026-08-14T05:02:11.716316Z","submitted_at":"2019-08-27T08:50:17Z","title":"Sentence-BERT: Sentence Embeddings using Siamese BERT-Networks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1908.10084","snapshot_observed_at":"2026-08-15T20:40:13.161587Z","title":"Sentence-bert: Sentence embeddings using siamese bert- networks","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.12346","last_updated":"2025-05-18T10:20:59Z","snapshot_observed_at":"2026-08-16T10:20:08.742919Z","submitted_at":"2025-05-18T10:20:59Z","title":"SEED-GRPO: Semantic Entropy Enhanced GRPO for Uncertainty-Aware Policy Optimization","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-15T20:40:13.161587Z"},"links":{"cited_paper":"/paper/1908.10084","citing_paper":"/paper/2505.12346"},"observation_digest":"sha256:da5dc7d3d8545751e40c5ad17b40b38026b7c27f63bd92ec411c427a8b95beeb","observation_id":"c22926a8-31ba-4a2b-9709-4450195aa258","resolution":{"observed_at":"2026-08-15T20:40:13.161587Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2004.09813","last_updated":"2020-10-05T06:30:56Z","snapshot_observed_at":"2026-08-13T18:36:05.448005Z","submitted_at":"2020-04-21T08:20:25Z","title":"Making Monolingual Sentence Embeddings Multilingual using Knowledge Distillation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2004.09813","snapshot_observed_at":"2026-08-15T20:40:13.165308Z","title":"Making monolingual sentence embeddings multilingual using knowledge distillation","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.12346","last_updated":"2025-05-18T10:20:59Z","snapshot_observed_at":"2026-08-16T10:20:08.742919Z","submitted_at":"2025-05-18T10:20:59Z","title":"SEED-GRPO: Semantic Entropy Enhanced GRPO for Uncertainty-Aware Policy Optimization","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-15T20:40:13.165308Z"},"links":{"cited_paper":"/paper/2004.09813","citing_paper":"/paper/2505.12346"},"observation_digest":"sha256:a8d5102ae44a3aa7f4659196eff777bc3136e5d602ccb30af5a3e8efb5993d3c","observation_id":"69e40fbb-3f69-438d-b86e-5541bab89966","resolution":{"observed_at":"2026-08-15T20:40:13.165308Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2505.12346","last_updated":"2025-05-18T10:20:59Z","latest_version":1,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-16T10:20:08.742919Z","submitted_at":"2025-05-18T10:20:59Z","title":"SEED-GRPO: Semantic Entropy Enhanced GRPO for Uncertainty-Aware Policy Optimization"},"reference_resolution":{"displayed":42,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":34,"verified_exact":0,"verified_fuzzy":8},"total_outbound_references":42},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"thesis":"As of 17 August 2026, this Paper Citation Record lists 42 of 42 outbound references and 35 inbound Pith citation observations for arXiv:2505.12346."}