{"as_of":"2026-08-10T11:32:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:5cc9249afacb4634a353b185bb9be89c931cee7d33f1d6742dac1c15f5f86f1a","coverage":[{"denominator":35,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":35,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T14:29:34.013794Z","state":"measured"},{"denominator":37,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":37,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T09:34:06.517190Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-11T15:16:09.090199Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.18830","last_updated":"2025-05-24T18:58:51Z","snapshot_observed_at":"2026-08-09T02:47:56.222742Z","submitted_at":"2025-05-24T18:58:51Z","title":"On the Effect of Negative Gradient in Group Relative Deep Reinforcement Optimization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.18830","snapshot_observed_at":"2026-08-04T09:34:06.517190Z","title":"On the effect of negative gradient in group relative deep reinforcement optimization","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.14807","last_updated":"2026-06-16T08:24:10Z","snapshot_observed_at":"2026-08-06T05:26:40.214370Z","submitted_at":"2025-10-16T15:40:49Z","title":"Beyond the Sampled Token: Preserving Candidate Support in RLVR","version":3},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-04T09:34:06.517190Z"},"links":{"cited_paper":"/paper/2505.18830","citing_paper":"/paper/2510.14807"},"observation_digest":"sha256:f9e7f855361014aa1d2dbebfc2ef7117f92d88b18d8aa1a5607c25d80fb2e75d","observation_id":"151aac32-085e-47ea-a121-e760e2719af9","resolution":{"observed_at":"2026-08-04T09:34:06.517190Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.18830","last_updated":"2025-05-24T18:58:51Z","snapshot_observed_at":"2026-08-09T02:47:56.222742Z","submitted_at":"2025-05-24T18:58:51Z","title":"On the Effect of Negative Gradient in Group Relative Deep Reinforcement Optimization","version":1},"cited_work":{"arxiv_id":"2505.18830","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.18830","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"arXiv preprint arXiv:2505.18830 , year=","venue":null,"work_id":"81875d2c-e026-402d-8335-a2bc0ed57719","year":null},"citing_paper":{"arxiv_id":"2605.00347","last_updated":"2026-05-01T02:05:56Z","snapshot_observed_at":"2026-07-06T23:13:47.082550Z","submitted_at":"2026-05-01T02:05:56Z","title":"Odysseus: Scaling VLMs to 100+ Turn Decision-Making in Games via Reinforcement Learning","version":1},"reference_index":78,"source":"arxiv_source","source_observed_at":"2026-05-09T20:22:58.061772Z"},"links":{"cited_paper":"/paper/2505.18830","citing_paper":"/paper/2605.00347"},"observation_digest":"sha256:08f827d1c243651ae40222df2db6ada412135650ff2c2e04c4b5fdf942d6134b","observation_id":"89a73c6b-0b37-423f-a8fd-f01398c0874b","resolution":{"observed_at":"2026-05-11T15:16:09.093200Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2505.18830/citation-record","integrity":"/paper/2505.18830/integrity","json":"/paper/2505.18830/citation-record.json","paper":"/paper/2505.18830"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:29:30.082862Z","title":"Gpg: A simple and strong reinforcement learning baseline for model reasoning.arXiv preprint arXiv:2504.02546, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.18830","last_updated":"2025-05-24T18:58:51Z","snapshot_observed_at":"2026-08-09T02:47:56.222742Z","submitted_at":"2025-05-24T18:58:51Z","title":"On the Effect of Negative Gradient in Group Relative Deep Reinforcement Optimization","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T14:29:30.082862Z"},"links":{"citing_paper":"/paper/2505.18830"},"observation_digest":"sha256:5a8be375f8a371ceec1d10aeee342dcaa32b79b18120e547da20b0e273d9d355","observation_id":"1c2ffe78-a13b-4ec9-8192-4f7d15c71d18","resolution":{"observed_at":"2026-08-07T14:29:30.082862Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.09344","last_updated":"2025-04-20T20:53:39Z","snapshot_observed_at":"2026-08-09T02:48:59.758433Z","submitted_at":"2024-10-12T03:21:58Z","title":"DARE the Extreme: Revisiting Delta-Parameter Pruning For Fine-Tuned Models","version":2},"cited_work":{"arxiv_id":"2410.09344","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.09344","snapshot_observed_at":"2026-08-07T14:29:34.429940Z","title":"DARE the Extreme: Revisiting Delta-Parameter Pruning For Fine-Tuned Models","venue":"cs.LG","work_id":"2aa3f133-b6e9-4b60-9bd3-cd3429b52f34","year":2024},"citing_paper":{"arxiv_id":"2505.18830","last_updated":"2025-05-24T18:58:51Z","snapshot_observed_at":"2026-08-09T02:47:56.222742Z","submitted_at":"2025-05-24T18:58:51Z","title":"On the Effect of Negative Gradient in Group Relative Deep Reinforcement Optimization","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T14:29:30.182581Z"},"links":{"cited_paper":"/paper/2410.09344","citing_paper":"/paper/2505.18830"},"observation_digest":"sha256:5e795b169ba6dbd15237df469ad85063e908d8f5ac35c6ac1ad17b0fec642443","observation_id":"3519a9e7-04f0-4dbb-8464-61e670ba6ace","resolution":{"observed_at":"2026-08-07T14:29:34.477945Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-07T14:29:30.352756Z","title":"Deepseek-r1: Incentivizing reasoning capability in llms via reinforcement learning.arXiv preprint arXiv:2501.12948, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.18830","last_updated":"2025-05-24T18:58:51Z","snapshot_observed_at":"2026-08-09T02:47:56.222742Z","submitted_at":"2025-05-24T18:58:51Z","title":"On the Effect of Negative Gradient in Group Relative Deep Reinforcement Optimization","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T14:29:30.352756Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2505.18830"},"observation_digest":"sha256:159d6d42c1798ab5c7f606b2bbd390869ecbb5d21064a5983388c5e7a6e9f921","observation_id":"b8da91cd-c47c-4176-8984-193b2cd7c071","resolution":{"observed_at":"2026-08-07T14:29:30.352756Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.14008","last_updated":"2024-06-06T13:19:44Z","snapshot_observed_at":"2026-08-03T03:39:09.398343Z","submitted_at":"2024-02-21T18:49:26Z","title":"OlympiadBench: A Challenging Benchmark for Promoting AGI with Olympiad-Level Bilingual Multimodal Scientific Problems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.14008","snapshot_observed_at":"2026-08-07T14:29:30.472429Z","title":"Olympiadbench: A challenging benchmark for promoting agi with olympiad-level bilingual multimodal scientific problems.arXiv preprint arXiv:2402.14008, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18830","last_updated":"2025-05-24T18:58:51Z","snapshot_observed_at":"2026-08-09T02:47:56.222742Z","submitted_at":"2025-05-24T18:58:51Z","title":"On the Effect of Negative Gradient in Group Relative Deep Reinforcement Optimization","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T14:29:30.472429Z"},"links":{"cited_paper":"/paper/2402.14008","citing_paper":"/paper/2505.18830"},"observation_digest":"sha256:424ee58e2b87716791913fc51fb8894f02ca9b6f3380a78b0413243c6b70df4a","observation_id":"0086d934-0735-4c00-b015-e426cf4b1793","resolution":{"observed_at":"2026-08-07T14:29:30.472429Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:29:35.679580Z","title":"The local elasticity of neural networks","venue":null,"work_id":"fb461c6d-a152-47ec-86e1-45e64f26d755","year":2020},"citing_paper":{"arxiv_id":"2505.18830","last_updated":"2025-05-24T18:58:51Z","snapshot_observed_at":"2026-08-09T02:47:56.222742Z","submitted_at":"2025-05-24T18:58:51Z","title":"On the Effect of Negative Gradient in Group Relative Deep Reinforcement Optimization","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T14:29:30.598230Z"},"links":{"citing_paper":"/paper/2505.18830"},"observation_digest":"sha256:35ac8181b5373ee1e887ddddf9aed4c63a81492fbe58bbb382e023b895321e24","observation_id":"ac04d9fc-c2c3-43dd-8890-51ecedb29804","resolution":{"observed_at":"2026-08-07T14:29:35.731705Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:29:30.787987Z","title":"Measuring mathematical problem solving with the math dataset","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.18830","last_updated":"2025-05-24T18:58:51Z","snapshot_observed_at":"2026-08-09T02:47:56.222742Z","submitted_at":"2025-05-24T18:58:51Z","title":"On the Effect of Negative Gradient in Group Relative Deep Reinforcement Optimization","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T14:29:30.787987Z"},"links":{"citing_paper":"/paper/2505.18830"},"observation_digest":"sha256:be439266ee9ee6a74c28e3934172c91f0d133de18cd777fbae15cabc0e42535a","observation_id":"4e9a462d-48e0-493d-a2e0-c32b91e59503","resolution":{"observed_at":"2026-08-07T14:29:30.787987Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.24290","last_updated":"2025-07-05T09:01:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-31T16:36:05Z","title":"Open-Reasoner-Zero: An Open Source Approach to Scaling Up Reinforcement Learning on the Base Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.24290","snapshot_observed_at":"2026-08-07T14:29:30.979686Z","title":"Open-reasoner-zero: An open source approach to scaling up reinforcement learning on the base model.arXiv preprint arXiv:2503.24290, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.18830","last_updated":"2025-05-24T18:58:51Z","snapshot_observed_at":"2026-08-09T02:47:56.222742Z","submitted_at":"2025-05-24T18:58:51Z","title":"On the Effect of Negative Gradient in Group Relative Deep Reinforcement Optimization","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T14:29:30.979686Z"},"links":{"cited_paper":"/paper/2503.24290","citing_paper":"/paper/2505.18830"},"observation_digest":"sha256:7786fbae8df28ffb1d73f5b1fb8236a90352db6744023922fff6fc855a9d09b1","observation_id":"01ee2673-2467-4663-a4dc-fe0a0a5ef0a9","resolution":{"observed_at":"2026-08-07T14:29:30.979686Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16720","last_updated":"2026-04-30T02:46:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-21T18:04:31Z","title":"OpenAI o1 System Card","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.16720","snapshot_observed_at":"2026-08-07T14:29:31.111041Z","title":"Openai o1 system card.arXiv preprint arXiv:2412.16720, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18830","last_updated":"2025-05-24T18:58:51Z","snapshot_observed_at":"2026-08-09T02:47:56.222742Z","submitted_at":"2025-05-24T18:58:51Z","title":"On the Effect of Negative Gradient in Group Relative Deep Reinforcement Optimization","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T14:29:31.111041Z"},"links":{"cited_paper":"/paper/2412.16720","citing_paper":"/paper/2505.18830"},"observation_digest":"sha256:15ee4dfd7690a6ff6423a7fc228e6a14832fa333dd14bb8c51c9ae97688fb033","observation_id":"e5e4e96a-22cc-4bcf-a91a-88ad472cf7c5","resolution":{"observed_at":"2026-08-07T14:29:31.111041Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.09516","last_updated":"2025-08-05T19:08:38Z","snapshot_observed_at":"2026-07-06T20:51:28.022519Z","submitted_at":"2025-03-12T16:26:39Z","title":"Search-R1: Training LLMs to Reason and Leverage Search Engines with Reinforcement Learning","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.09516","snapshot_observed_at":"2026-08-07T14:29:31.259139Z","title":"Search-r1: Training llms to reason and leverage search engines with reinforcement learning.arXiv preprint arXiv:2503.09516, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.18830","last_updated":"2025-05-24T18:58:51Z","snapshot_observed_at":"2026-08-09T02:47:56.222742Z","submitted_at":"2025-05-24T18:58:51Z","title":"On the Effect of Negative Gradient in Group Relative Deep Reinforcement Optimization","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T14:29:31.259139Z"},"links":{"cited_paper":"/paper/2503.09516","citing_paper":"/paper/2505.18830"},"observation_digest":"sha256:5a0a8d218584bea86218872562f7500be4e9cd59b2a96f24b02c881248e7fcbc","observation_id":"2e95c004-02d1-453c-956a-8e17c1eb7a31","resolution":{"observed_at":"2026-08-07T14:29:31.259139Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:29:31.370676Z","title":"Med-r1: Reinforce- ment learning for generalizable medical reasoning in vision-language models.arXiv preprint arXiv:2503.13939, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.18830","last_updated":"2025-05-24T18:58:51Z","snapshot_observed_at":"2026-08-09T02:47:56.222742Z","submitted_at":"2025-05-24T18:58:51Z","title":"On the Effect of Negative Gradient in Group Relative Deep Reinforcement Optimization","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T14:29:31.370676Z"},"links":{"citing_paper":"/paper/2505.18830"},"observation_digest":"sha256:665c7dcd792c3f55c37da61023c9d5cbcd76aaa8721518d38f0823c01269aa18","observation_id":"0213d9c1-098d-47b5-98e7-bc3263b303e9","resolution":{"observed_at":"2026-08-07T14:29:31.370676Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:29:31.497301Z","title":"Solving quantitative reasoning problems with language models.Advances in Neural Information Processing Systems, 35:3843–3857, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.18830","last_updated":"2025-05-24T18:58:51Z","snapshot_observed_at":"2026-08-09T02:47:56.222742Z","submitted_at":"2025-05-24T18:58:51Z","title":"On the Effect of Negative Gradient in Group Relative Deep Reinforcement Optimization","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T14:29:31.497301Z"},"links":{"citing_paper":"/paper/2505.18830"},"observation_digest":"sha256:208bde4c0d31250dea0281d5ed31781185bf24f2a214d031f1718c9eca1280d4","observation_id":"287758ef-d131-493f-a2a3-6fab4b88f346","resolution":{"observed_at":"2026-08-07T14:29:31.497301Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20783","last_updated":"2025-10-06T09:30:03Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-26T17:59:14Z","title":"Understanding R1-Zero-Like Training: A Critical Perspective","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.20783","snapshot_observed_at":"2026-08-07T14:29:31.672136Z","title":"Understanding r1-zero-like training: A critical perspective.arXiv preprint arXiv:2503.20783, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.18830","last_updated":"2025-05-24T18:58:51Z","snapshot_observed_at":"2026-08-09T02:47:56.222742Z","submitted_at":"2025-05-24T18:58:51Z","title":"On the Effect of Negative Gradient in Group Relative Deep Reinforcement Optimization","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T14:29:31.672136Z"},"links":{"cited_paper":"/paper/2503.20783","citing_paper":"/paper/2505.18830"},"observation_digest":"sha256:833b4707357d2784c6a1c7498650af9460044501d2365e6e17960e01fe90c399","observation_id":"9138a9b8-c697-454e-9c8b-b2c04ae9b2f8","resolution":{"observed_at":"2026-08-07T14:29:31.672136Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:29:31.844838Z","title":"Deepscaler: Surpassing o1-preview with a 1.5b model by scaling rl, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.18830","last_updated":"2025-05-24T18:58:51Z","snapshot_observed_at":"2026-08-09T02:47:56.222742Z","submitted_at":"2025-05-24T18:58:51Z","title":"On the Effect of Negative Gradient in Group Relative Deep Reinforcement Optimization","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T14:29:31.844838Z"},"links":{"citing_paper":"/paper/2505.18830"},"observation_digest":"sha256:8a4b891d5052390c200bd561afd9d71402e09d370f40f05ba57e02cdfa515d5e","observation_id":"4bbda4f8-5219-4a63-b4d3-aca75d7097e0","resolution":{"observed_at":"2026-08-07T14:29:31.844838Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:29:35.551414Z","title":"Neural collapse with unconstrained features","venue":null,"work_id":"74db6181-26de-4949-8dcd-b87965d653a7","year":2022},"citing_paper":{"arxiv_id":"2505.18830","last_updated":"2025-05-24T18:58:51Z","snapshot_observed_at":"2026-08-09T02:47:56.222742Z","submitted_at":"2025-05-24T18:58:51Z","title":"On the Effect of Negative Gradient in Group Relative Deep Reinforcement Optimization","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T14:29:32.001012Z"},"links":{"citing_paper":"/paper/2505.18830"},"observation_digest":"sha256:099f6f29fdafed7e46339038bd24610d5e973626e7691f6206fd8a72b9ad0190","observation_id":"65cf08cb-4b81-423b-9bfe-765f73129ae8","resolution":{"observed_at":"2026-08-07T14:29:35.585539Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.13228","last_updated":"2024-07-03T13:46:33Z","snapshot_observed_at":"2026-08-08T16:03:10.053914Z","submitted_at":"2024-02-20T18:42:34Z","title":"Smaug: Fixing Failure Modes of Preference Optimisation with DPO-Positive","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.13228","snapshot_observed_at":"2026-08-07T14:29:32.198096Z","title":"Smaug: Fixing failure modes of preference optimisation with dpo-positive.arXiv preprint arXiv:2402.13228, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18830","last_updated":"2025-05-24T18:58:51Z","snapshot_observed_at":"2026-08-09T02:47:56.222742Z","submitted_at":"2025-05-24T18:58:51Z","title":"On the Effect of Negative Gradient in Group Relative Deep Reinforcement Optimization","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T14:29:32.198096Z"},"links":{"cited_paper":"/paper/2402.13228","citing_paper":"/paper/2505.18830"},"observation_digest":"sha256:470c8807458098ce09ebde2952c777ded9e02ee8bc8a8934bfc07ddbdeeaa59a","observation_id":"cc9af7d2-8533-41df-8f1b-6f9a67183a9e","resolution":{"observed_at":"2026-08-07T14:29:32.198096Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:29:32.334464Z","title":"Direct preference optimization: Your language model is secretly a reward model","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.18830","last_updated":"2025-05-24T18:58:51Z","snapshot_observed_at":"2026-08-09T02:47:56.222742Z","submitted_at":"2025-05-24T18:58:51Z","title":"On the Effect of Negative Gradient in Group Relative Deep Reinforcement Optimization","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T14:29:32.334464Z"},"links":{"citing_paper":"/paper/2505.18830"},"observation_digest":"sha256:a8a2057e933559f459634567ad08db1c6ea62a053dce5a8df26a52cfb1d38af4","observation_id":"fd6b3d69-c9a3-4268-8dc1-340694b26bfb","resolution":{"observed_at":"2026-08-07T14:29:32.334464Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.08847","last_updated":"2025-04-27T15:21:29Z","snapshot_observed_at":"2026-07-06T19:31:49.052556Z","submitted_at":"2024-10-11T14:22:44Z","title":"Unintentional Unalignment: Likelihood Displacement in Direct Preference Optimization","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.08847","snapshot_observed_at":"2026-08-07T14:29:32.444781Z","title":"Unintentional unalignment: Likelihood displacement in direct preference optimization.arXiv preprint arXiv:2410.08847, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18830","last_updated":"2025-05-24T18:58:51Z","snapshot_observed_at":"2026-08-09T02:47:56.222742Z","submitted_at":"2025-05-24T18:58:51Z","title":"On the Effect of Negative Gradient in Group Relative Deep Reinforcement Optimization","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T14:29:32.444781Z"},"links":{"cited_paper":"/paper/2410.08847","citing_paper":"/paper/2505.18830"},"observation_digest":"sha256:1775e31c4108d25c821edd0e447a7fdf6a2a311945f1e1a402bf0554327008e2","observation_id":"d3f472fa-05a6-4984-b680-13d8fa5b52de","resolution":{"observed_at":"2026-08-07T14:29:32.444781Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.10490","last_updated":"2025-06-29T05:43:22Z","snapshot_observed_at":"2026-08-01T14:47:14.023229Z","submitted_at":"2024-07-15T07:30:28Z","title":"Learning Dynamics of LLM Finetuning","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.10490","snapshot_observed_at":"2026-08-07T14:29:32.572317Z","title":"Learning dynamics of llm finetuning.arXiv preprint arXiv:2407.10490, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18830","last_updated":"2025-05-24T18:58:51Z","snapshot_observed_at":"2026-08-09T02:47:56.222742Z","submitted_at":"2025-05-24T18:58:51Z","title":"On the Effect of Negative Gradient in Group Relative Deep Reinforcement Optimization","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T14:29:32.572317Z"},"links":{"cited_paper":"/paper/2407.10490","citing_paper":"/paper/2505.18830"},"observation_digest":"sha256:56b7c0af299d15bae76e4c55cf2cc4d0a149b431d7b6aadb777b7281a746c648","observation_id":"cb0aa861-d8ce-4d6a-9d29-a536550589d8","resolution":{"observed_at":"2026-08-07T14:29:32.572317Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-07T14:29:32.710722Z","title":"Proximal policy optimization algorithms.arXiv preprint arXiv:1707.06347, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.18830","last_updated":"2025-05-24T18:58:51Z","snapshot_observed_at":"2026-08-09T02:47:56.222742Z","submitted_at":"2025-05-24T18:58:51Z","title":"On the Effect of Negative Gradient in Group Relative Deep Reinforcement Optimization","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T14:29:32.710722Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2505.18830"},"observation_digest":"sha256:abede2a4ef04a6192be97b003ff7ba0a11ec242776bc68db4dd1226879e292c6","observation_id":"41608882-f242-4ed3-8191-4bc586c69a70","resolution":{"observed_at":"2026-08-07T14:29:32.710722Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-07T14:29:32.815490Z","title":"Deepseekmath: Pushing the limits of mathematical reasoning in open language models.arXiv preprint arXiv:2402.03300, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18830","last_updated":"2025-05-24T18:58:51Z","snapshot_observed_at":"2026-08-09T02:47:56.222742Z","submitted_at":"2025-05-24T18:58:51Z","title":"On the Effect of Negative Gradient in Group Relative Deep Reinforcement Optimization","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T14:29:32.815490Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2505.18830"},"observation_digest":"sha256:a811854f5842421b8c30e2b2d123ba0c743e012a121e3e7006860f7d6ac4d8ad","observation_id":"726ede61-1ee1-403e-9235-575fa2c83438","resolution":{"observed_at":"2026-08-07T14:29:32.815490Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11805","last_updated":"2025-05-09T21:04:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-19T02:39:27Z","title":"Gemini: A Family of Highly Capable Multimodal Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.11805","snapshot_observed_at":"2026-08-07T14:29:32.921726Z","title":"Gemini: a family of highly capable multimodal models.arXiv preprint arXiv:2312.11805, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.18830","last_updated":"2025-05-24T18:58:51Z","snapshot_observed_at":"2026-08-09T02:47:56.222742Z","submitted_at":"2025-05-24T18:58:51Z","title":"On the Effect of Negative Gradient in Group Relative Deep Reinforcement Optimization","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T14:29:32.921726Z"},"links":{"cited_paper":"/paper/2312.11805","citing_paper":"/paper/2505.18830"},"observation_digest":"sha256:a9d87713615361833c0e95ae35fa12ac4fbaad635cce8e9ca793682c41d2db23","observation_id":"01b333f3-1f0b-4378-a7d7-4d48e3286691","resolution":{"observed_at":"2026-08-07T14:29:32.921726Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:29:35.395538Z","title":"Aime problem set 1983-2024, 2023","venue":null,"work_id":"09f35c40-84eb-4e8a-a5ed-c5128ddbdcc6","year":1983},"citing_paper":{"arxiv_id":"2505.18830","last_updated":"2025-05-24T18:58:51Z","snapshot_observed_at":"2026-08-09T02:47:56.222742Z","submitted_at":"2025-05-24T18:58:51Z","title":"On the Effect of Negative Gradient in Group Relative Deep Reinforcement Optimization","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T14:29:33.000764Z"},"links":{"citing_paper":"/paper/2505.18830"},"observation_digest":"sha256:a6b7ddeba00beddac6126529edb92e1ecf35fa6b66ab4dbb6863c8c3c5e1b44d","observation_id":"96dff3bd-5d64-4f4f-ae3c-5372b0de278a","resolution":{"observed_at":"2026-08-07T14:29:35.509164Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15115","snapshot_observed_at":"2026-08-07T14:29:33.073364Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18830","last_updated":"2025-05-24T18:58:51Z","snapshot_observed_at":"2026-08-09T02:47:56.222742Z","submitted_at":"2025-05-24T18:58:51Z","title":"On the Effect of Negative Gradient in Group Relative Deep Reinforcement Optimization","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T14:29:33.073364Z"},"links":{"cited_paper":"/paper/2412.15115","citing_paper":"/paper/2505.18830"},"observation_digest":"sha256:aeaaacc85282997a9582c60edb31a4ce59b0876c1b0b20b9d3199208211d0489","observation_id":"21575429-1287-40a5-b8cd-f7afa7856141","resolution":{"observed_at":"2026-08-07T14:29:33.073364Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12122","last_updated":"2024-09-18T16:45:37Z","snapshot_observed_at":"2026-07-06T19:17:41.512834Z","submitted_at":"2024-09-18T16:45:37Z","title":"Qwen2.5-Math Technical Report: Toward Mathematical Expert Model via Self-Improvement","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12122","snapshot_observed_at":"2026-08-07T14:29:33.120361Z","title":"Qwen2.5-math technical report: Toward mathematical expert model via self-improvement.arXiv preprint arXiv:2409.12122, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18830","last_updated":"2025-05-24T18:58:51Z","snapshot_observed_at":"2026-08-09T02:47:56.222742Z","submitted_at":"2025-05-24T18:58:51Z","title":"On the Effect of Negative Gradient in Group Relative Deep Reinforcement Optimization","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T14:29:33.120361Z"},"links":{"cited_paper":"/paper/2409.12122","citing_paper":"/paper/2505.18830"},"observation_digest":"sha256:d95222d01b37d97e687a39b6291dedd231155f2a76ae1985eda988c5cc5750c9","observation_id":"a15f090f-5325-4091-b01e-7fe9210c3d57","resolution":{"observed_at":"2026-08-07T14:29:33.120361Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1711.03953","last_updated":"2018-03-02T20:20:52Z","snapshot_observed_at":"2026-08-04T06:22:23.897655Z","submitted_at":"2017-11-10T18:29:00Z","title":"Breaking the Softmax Bottleneck: A High-Rank RNN Language Model","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1711.03953","snapshot_observed_at":"2026-08-07T14:29:33.191566Z","title":"Breaking the softmax bottleneck: A high-rank rnn language model.arXiv preprint arXiv:1711.03953, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.18830","last_updated":"2025-05-24T18:58:51Z","snapshot_observed_at":"2026-08-09T02:47:56.222742Z","submitted_at":"2025-05-24T18:58:51Z","title":"On the Effect of Negative Gradient in Group Relative Deep Reinforcement Optimization","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T14:29:33.191566Z"},"links":{"cited_paper":"/paper/1711.03953","citing_paper":"/paper/2505.18830"},"observation_digest":"sha256:dd347d3a85fcba44fc4401644d1d18b4fb45fd3b834227ac9f0c81709f82730d","observation_id":"bd1349c0-d83a-4598-8710-ddbb685d6d35","resolution":{"observed_at":"2026-08-07T14:29:33.191566Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.12284","last_updated":"2024-05-03T17:36:07Z","snapshot_observed_at":"2026-08-02T15:00:50.388422Z","submitted_at":"2023-09-21T17:45:42Z","title":"MetaMath: Bootstrap Your Own Mathematical Questions for Large Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.12284","snapshot_observed_at":"2026-08-07T14:29:33.267870Z","title":"Metamath: Bootstrap your own mathematical questions for large language models.arXiv preprint arXiv:2309.12284, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.18830","last_updated":"2025-05-24T18:58:51Z","snapshot_observed_at":"2026-08-09T02:47:56.222742Z","submitted_at":"2025-05-24T18:58:51Z","title":"On the Effect of Negative Gradient in Group Relative Deep Reinforcement Optimization","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T14:29:33.267870Z"},"links":{"cited_paper":"/paper/2309.12284","citing_paper":"/paper/2505.18830"},"observation_digest":"sha256:57bba9a8421a3a2ef6ea85507b32bd9c1557ce5dd158e52b3c928ac1fc30792f","observation_id":"86e8509a-9d1f-4541-8271-238cb2c324a4","resolution":{"observed_at":"2026-08-07T14:29:33.267870Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14476","last_updated":"2025-05-20T01:37:34Z","snapshot_observed_at":"2026-08-02T01:40:54.187278Z","submitted_at":"2025-03-18T17:49:06Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.14476","snapshot_observed_at":"2026-08-07T14:29:33.323315Z","title":"Dapo: An open-source llm reinforcement learning system at scale.arXiv preprint arXiv:2503.14476, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.18830","last_updated":"2025-05-24T18:58:51Z","snapshot_observed_at":"2026-08-09T02:47:56.222742Z","submitted_at":"2025-05-24T18:58:51Z","title":"On the Effect of Negative Gradient in Group Relative Deep Reinforcement Optimization","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T14:29:33.323315Z"},"links":{"cited_paper":"/paper/2503.14476","citing_paper":"/paper/2505.18830"},"observation_digest":"sha256:cd3455371a0142945b0019bcc3ea2adc7c5c564aeebdeebfcbeefb5720561fac","observation_id":"1e7a4dd1-a25f-4783-b71d-bac8905ba860","resolution":{"observed_at":"2026-08-07T14:29:33.323315Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.02078","last_updated":"2024-04-02T16:25:30Z","snapshot_observed_at":"2026-08-09T02:47:29.602129Z","submitted_at":"2024-04-02T16:25:30Z","title":"Advancing LLM Reasoning Generalists with Preference Trees","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.02078","snapshot_observed_at":"2026-08-07T14:29:33.431718Z","title":"Advancing llm reasoning generalists with preference trees.arXiv preprint arXiv:2404.02078, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18830","last_updated":"2025-05-24T18:58:51Z","snapshot_observed_at":"2026-08-09T02:47:56.222742Z","submitted_at":"2025-05-24T18:58:51Z","title":"On the Effect of Negative Gradient in Group Relative Deep Reinforcement Optimization","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T14:29:33.431718Z"},"links":{"cited_paper":"/paper/2404.02078","citing_paper":"/paper/2505.18830"},"observation_digest":"sha256:5c598761ef2e0d423118c35846c9b78e1d0d0f14d8b1f60ce3055e36753966fc","observation_id":"5bab72b9-5519-4cfb-8f12-b78c64860908","resolution":{"observed_at":"2026-08-07T14:29:33.431718Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.18892","last_updated":"2025-08-06T08:42:32Z","snapshot_observed_at":"2026-07-06T20:57:57.039376Z","submitted_at":"2025-03-24T17:06:10Z","title":"SimpleRL-Zoo: Investigating and Taming Zero Reinforcement Learning for Open Base Models in the Wild","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.18892","snapshot_observed_at":"2026-08-07T14:29:33.492988Z","title":"Simplerl-zoo: Investigating and taming zero reinforcement learning for open base models in the wild.arXiv preprint arXiv:2503.18892, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.18830","last_updated":"2025-05-24T18:58:51Z","snapshot_observed_at":"2026-08-09T02:47:56.222742Z","submitted_at":"2025-05-24T18:58:51Z","title":"On the Effect of Negative Gradient in Group Relative Deep Reinforcement Optimization","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T14:29:33.492988Z"},"links":{"cited_paper":"/paper/2503.18892","citing_paper":"/paper/2505.18830"},"observation_digest":"sha256:e14d52756d834462b5f142b38b97d544e4ac30170a0b657c41566a148717735a","observation_id":"b04807af-9df9-4bc3-b30c-5558edf2ef4f","resolution":{"observed_at":"2026-08-07T14:29:33.492988Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.15417","last_updated":"2025-02-19T02:31:46Z","snapshot_observed_at":"2026-08-10T01:20:11.418841Z","submitted_at":"2024-08-27T21:46:47Z","title":"Implicit Geometry of Next-token Prediction: From Language Sparsity Patterns to Model Representations","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.15417","snapshot_observed_at":"2026-08-07T14:29:33.608339Z","title":"Implicit geometry of next-token prediction: From language sparsity patterns to model representations.arXiv preprint arXiv:2408.15417, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18830","last_updated":"2025-05-24T18:58:51Z","snapshot_observed_at":"2026-08-09T02:47:56.222742Z","submitted_at":"2025-05-24T18:58:51Z","title":"On the Effect of Negative Gradient in Group Relative Deep Reinforcement Optimization","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T14:29:33.608339Z"},"links":{"cited_paper":"/paper/2408.15417","citing_paper":"/paper/2505.18830"},"observation_digest":"sha256:2c6d2179d66d6ecb61781f607155cc41ad125bd58ff6be978a5ca9302e91bce4","observation_id":"4177ec77-2d36-4819-af22-815479f91d08","resolution":{"observed_at":"2026-08-07T14:29:33.608339Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:29:35.232657Z","title":"one commercially available ten-button lock may be opened by pressing – in any order – the correct five buttons","venue":null,"work_id":"5513be8f-6d2d-4faf-8724-fe5a9cecbedf","year":null},"citing_paper":{"arxiv_id":"2505.18830","last_updated":"2025-05-24T18:58:51Z","snapshot_observed_at":"2026-08-09T02:47:56.222742Z","submitted_at":"2025-05-24T18:58:51Z","title":"On the Effect of Negative Gradient in Group Relative Deep Reinforcement Optimization","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T14:29:33.696512Z"},"links":{"citing_paper":"/paper/2505.18830"},"observation_digest":"sha256:c363dc1ca65028bc13b3af3154612c64316ca2af4bc0ecd26a37887a7f3f4776","observation_id":"93de0474-6ead-4896-9f95-87061801dad4","resolution":{"observed_at":"2026-08-07T14:29:35.313069Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:29:35.014612Z","title":"From the given graph, we can observe the following: - The roots off(x)are atx= 1 andx= 3","venue":null,"work_id":"5e3e6008-cd40-4a74-95ce-c12ebb2bdffd","year":null},"citing_paper":{"arxiv_id":"2505.18830","last_updated":"2025-05-24T18:58:51Z","snapshot_observed_at":"2026-08-09T02:47:56.222742Z","submitted_at":"2025-05-24T18:58:51Z","title":"On the Effect of Negative Gradient in Group Relative Deep Reinforcement Optimization","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T14:29:33.803416Z"},"links":{"citing_paper":"/paper/2505.18830"},"observation_digest":"sha256:40d58921dfea9e8081e5c69bd5811aeaf4ed8abbd0a24875da85b0c64d2c08e1","observation_id":"37e0f6f9-5bc9-40c9-95f9-8c882721387e","resolution":{"observed_at":"2026-08-07T14:29:35.094259Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:29:34.918851Z","title":"Therefore: - The roots of g(x)are also atx= 1 andx= 3","venue":null,"work_id":"db3ef681-d486-4940-a407-d24ef18184b5","year":null},"citing_paper":{"arxiv_id":"2505.18830","last_updated":"2025-05-24T18:58:51Z","snapshot_observed_at":"2026-08-09T02:47:56.222742Z","submitted_at":"2025-05-24T18:58:51Z","title":"On the Effect of Negative Gradient in Group Relative Deep Reinforcement Optimization","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T14:29:33.875782Z"},"links":{"citing_paper":"/paper/2505.18830"},"observation_digest":"sha256:1b4a505981284499a8e7b184ff31844ef4c30371f2d9783f2648be72c1b67a69","observation_id":"1ad0abfb-49ad-4c55-80ac-4b4a33f33c88","resolution":{"observed_at":"2026-08-07T14:29:34.956361Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:29:34.821703Z","title":"This simplifies to: f(x) = 0 The roots off(x)are atx= 1 andx= 3","venue":null,"work_id":"1e1f24c9-2200-442c-9a46-73c2c264cf30","year":null},"citing_paper":{"arxiv_id":"2505.18830","last_updated":"2025-05-24T18:58:51Z","snapshot_observed_at":"2026-08-09T02:47:56.222742Z","submitted_at":"2025-05-24T18:58:51Z","title":"On the Effect of Negative Gradient in Group Relative Deep Reinforcement Optimization","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T14:29:33.935421Z"},"links":{"citing_paper":"/paper/2505.18830"},"observation_digest":"sha256:46b5a838cd25e3de71569158a1205a919ab65901e6c9c9140db7196b61ef2001","observation_id":"7ba4801a-f4b9-485c-8328-5cb5b74f5928","resolution":{"observed_at":"2026-08-07T14:29:34.870775Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:29:34.665427Z","title":"This implies thatf(x)is an even function, and its graph is symmetric about the y-axis","venue":null,"work_id":"180e1769-dcc9-4d73-b573-0cddbdb4b782","year":null},"citing_paper":{"arxiv_id":"2505.18830","last_updated":"2025-05-24T18:58:51Z","snapshot_observed_at":"2026-08-09T02:47:56.222742Z","submitted_at":"2025-05-24T18:58:51Z","title":"On the Effect of Negative Gradient in Group Relative Deep Reinforcement Optimization","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T14:29:34.013794Z"},"links":{"citing_paper":"/paper/2505.18830"},"observation_digest":"sha256:2e0146323e397842ad0844dda286f2e1723baba2cd1c27bfac897e41ca4e0ee4","observation_id":"d34fc82a-47eb-4b63-883c-158d98591680","resolution":{"observed_at":"2026-08-07T14:29:34.738641Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2505.18830","last_updated":"2025-05-24T18:58:51Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-09T02:47:56.222742Z","submitted_at":"2025-05-24T18:58:51Z","title":"On the Effect of Negative Gradient in Group Relative Deep Reinforcement Optimization"},"reference_resolution":{"displayed":35,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":26,"verified_exact":1,"verified_fuzzy":7},"total_outbound_references":35},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 35 of 35 outbound references and 2 inbound Pith citation observations for arXiv:2505.18830."}