{"as_of":"2026-08-19T12:16:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:9867396d26309678e3b81fdea34d82242c8424caa4a30c3e9a23dccd2003e6f4","coverage":[{"denominator":27,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":27,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-10T14:25:07.006233Z","state":"measured"},{"denominator":27,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":27,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-19T06:32:44.657259+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.07976/citation-record","integrity":"/paper/2607.07976/integrity","json":"/paper/2607.07976/citation-record.json","paper":"/paper/2607.07976"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T14:27:07.512699Z","title":"Deepseek-r1 incentivizes reasoning in llms through reinforcement learning.Nature, 645(8081):633–638","venue":null,"work_id":"f01253de-58e9-4b0f-a91e-4ef797517a24","year":2025},"citing_paper":{"arxiv_id":"2607.07976","last_updated":"2026-07-08T23:00:54Z","snapshot_observed_at":"2026-08-12T14:19:36.332471Z","submitted_at":"2026-07-08T23:00:54Z","title":"When Implausible Tokens Get Reinforced: Tail-Aware Credit Calibration for LLM Reinforcement Learning","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-07-10T14:25:07.006233Z"},"links":{"citing_paper":"/paper/2607.07976"},"observation_digest":"sha256:633302d4e553984e1952b2c62a8470006d82accc260a04df4d1c4cbfc9c84339","observation_id":"6f939aa2-c97f-4ece-a945-caa962951124","resolution":{"observed_at":"2026-07-10T14:27:07.513959Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2024.acl-long.211","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"O lympiad B ench: A Challenging Benchmark for Promoting AGI with Olympiad-Level Bilingual Multimodal Scientific Problems","venue":null,"work_id":"7b3c92e2-292d-4caa-8dbe-e949ccf083a8","year":2024},"citing_paper":{"arxiv_id":"2607.07976","last_updated":"2026-07-08T23:00:54Z","snapshot_observed_at":"2026-08-12T14:19:36.332471Z","submitted_at":"2026-07-08T23:00:54Z","title":"When Implausible Tokens Get Reinforced: Tail-Aware Credit Calibration for LLM Reinforcement Learning","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-07-10T14:25:07.006233Z"},"links":{"citing_paper":"/paper/2607.07976"},"observation_digest":"sha256:bc669b6b2494ed79512a55bc431f68267a87f74854c8cd2d842bfd9bd6a92a5f","observation_id":"62f0072d-42cc-49d5-8032-ab5669f3fbfa","resolution":{"observed_at":"2026-07-10T14:27:07.150173Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-07T20:38:25.422554+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-07T20:38:25.422554+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T14:27:07.520833Z","title":"The curious case of neural text degeneration","venue":null,"work_id":"aaf7b4c6-38c4-4c86-8301-75004f0fbf0d","year":2020},"citing_paper":{"arxiv_id":"2607.07976","last_updated":"2026-07-08T23:00:54Z","snapshot_observed_at":"2026-08-12T14:19:36.332471Z","submitted_at":"2026-07-08T23:00:54Z","title":"When Implausible Tokens Get Reinforced: Tail-Aware Credit Calibration for LLM Reinforcement Learning","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-07-10T14:25:07.006233Z"},"links":{"citing_paper":"/paper/2607.07976"},"observation_digest":"sha256:f837839a4706bab3922b5882c31376535e35430b773a151b3b8554d4b6926a9e","observation_id":"889c4786-37d5-48d0-b766-416aac88aafa","resolution":{"observed_at":"2026-07-10T14:27:07.522253Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T14:27:07.508829Z","title":"Large language models cannot self-correct reasoning yet","venue":null,"work_id":"54813747-7e4c-48be-bc31-034b0958cd20","year":2024},"citing_paper":{"arxiv_id":"2607.07976","last_updated":"2026-07-08T23:00:54Z","snapshot_observed_at":"2026-08-12T14:19:36.332471Z","submitted_at":"2026-07-08T23:00:54Z","title":"When Implausible Tokens Get Reinforced: Tail-Aware Credit Calibration for LLM Reinforcement Learning","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-07-10T14:25:07.006233Z"},"links":{"citing_paper":"/paper/2607.07976"},"observation_digest":"sha256:5c8e9c512567f3ab96bdb9781ee652bf3beb5856fb9fcef82ae97d029271a5ac","observation_id":"371fe2a7-ef04-4efb-918f-889151363546","resolution":{"observed_at":"2026-07-10T14:27:07.510160Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T14:27:07.518215Z","title":"URLhttps://openreview.net/forum?id=IkmD3fKBPQ","venue":null,"work_id":"a4ec2d55-a9f2-49e3-9178-005d082a00f9","year":2024},"citing_paper":{"arxiv_id":"2607.07976","last_updated":"2026-07-08T23:00:54Z","snapshot_observed_at":"2026-08-12T14:19:36.332471Z","submitted_at":"2026-07-08T23:00:54Z","title":"When Implausible Tokens Get Reinforced: Tail-Aware Credit Calibration for LLM Reinforcement Learning","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-07-10T14:25:07.006233Z"},"links":{"citing_paper":"/paper/2607.07976"},"observation_digest":"sha256:b871b5a4f414c8fe9b5cd60b6d67c7a8481c4f3d464bfccdf2481395e4ffe2a2","observation_id":"5ca50a82-9f01-4344-85cb-904541018532","resolution":{"observed_at":"2026-07-10T14:27:07.519445Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2603.16158","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T14:27:07.360614Z","title":"Execution-grounded credit assignment for grpo in code generation.arXiv preprint arXiv:2603.16158, 2026","venue":null,"work_id":"104a4156-d36a-4e15-8f04-bf795d67e387","year":2026},"citing_paper":{"arxiv_id":"2607.07976","last_updated":"2026-07-08T23:00:54Z","snapshot_observed_at":"2026-08-12T14:19:36.332471Z","submitted_at":"2026-07-08T23:00:54Z","title":"When Implausible Tokens Get Reinforced: Tail-Aware Credit Calibration for LLM Reinforcement Learning","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-07-10T14:25:07.006233Z"},"links":{"citing_paper":"/paper/2607.07976"},"observation_digest":"sha256:c10fb9601815d6ea1bc8c31094c29b98049749024308860f83c430a4cb785352","observation_id":"d9cacb44-7e90-4b73-813b-888370759ec5","resolution":{"observed_at":"2026-07-10T14:27:07.362244Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T14:27:07.518886Z","title":"Ramasesh, Ambrose Slone, Cem Anil, Imanol Schlag, Theo Gutman-Solo, Yuhuai Wu, Behnam Neyshabur, Guy Gur-Ari, and Vedant Misra","venue":null,"work_id":"b7c2e9af-42d2-4b07-9e68-e5eaaa27b3cf","year":2022},"citing_paper":{"arxiv_id":"2607.07976","last_updated":"2026-07-08T23:00:54Z","snapshot_observed_at":"2026-08-12T14:19:36.332471Z","submitted_at":"2026-07-08T23:00:54Z","title":"When Implausible Tokens Get Reinforced: Tail-Aware Credit Calibration for LLM Reinforcement Learning","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-07-10T14:25:07.006233Z"},"links":{"citing_paper":"/paper/2607.07976"},"observation_digest":"sha256:964d7e82050cd8aa291fc7218df1cc137dfa4debb445d2278e5ec3fe86cf9553","observation_id":"8f841fa7-bbd9-4c3c-80e9-94cd255008cc","resolution":{"observed_at":"2026-07-10T14:27:07.520180Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.20050","last_updated":"2023-05-31T17:24:00Z","snapshot_observed_at":"2026-08-17T09:42:34.746112Z","submitted_at":"2023-05-31T17:24:00Z","title":"Let's Verify Step by Step","version":1},"cited_work":{"arxiv_id":"2305.20050","doi":"10.1007/bf00262952","metadata_source":"pith","pith_arxiv_id":"2305.20050","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Let's Verify Step by Step","venue":"cs.LG","work_id":"6d05b790-04c5-4fd2-91b2-ba1dfdd5770f","year":2023},"citing_paper":{"arxiv_id":"2607.07976","last_updated":"2026-07-08T23:00:54Z","snapshot_observed_at":"2026-08-12T14:19:36.332471Z","submitted_at":"2026-07-08T23:00:54Z","title":"When Implausible Tokens Get Reinforced: Tail-Aware Credit Calibration for LLM Reinforcement Learning","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-07-10T14:25:07.006233Z"},"links":{"cited_paper":"/paper/2305.20050","citing_paper":"/paper/2607.07976"},"observation_digest":"sha256:17e2709b03b0a60a660000e00f4c90f918858df0a730e67113a537b80b1f1f2c","observation_id":"c6b3cc15-1af5-43fc-a7ed-70a27c62fdc7","resolution":{"observed_at":"2026-07-10T14:27:07.380941Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T14:27:07.513002Z","title":"Heterogeneous adaptive policy optimization: Tailoring optimization to every token’s nature,","venue":null,"work_id":"7077b45a-d731-4f08-a91d-57d9c4ab17a5","year":null},"citing_paper":{"arxiv_id":"2607.07976","last_updated":"2026-07-08T23:00:54Z","snapshot_observed_at":"2026-08-12T14:19:36.332471Z","submitted_at":"2026-07-08T23:00:54Z","title":"When Implausible Tokens Get Reinforced: Tail-Aware Credit Calibration for LLM Reinforcement Learning","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-07-10T14:25:07.006233Z"},"links":{"citing_paper":"/paper/2607.07976"},"observation_digest":"sha256:14d0de983d8a0bee7cf43e51c2ce1f5a0468053a83fef020e314f4cee3c494ca","observation_id":"3c72e548-1c77-44d7-a5c6-9aee68ec78be","resolution":{"observed_at":"2026-07-10T14:27:07.514418Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.16591","last_updated":"2026-04-29T06:03:04Z","snapshot_observed_at":"2026-08-15T20:00:23.013365Z","submitted_at":"2025-09-20T09:30:25Z","title":"Heterogeneous Adaptive Policy Optimization: Tailoring Optimization to Every Token's Nature","version":2},"cited_work":{"arxiv_id":"2509.16591","doi":null,"metadata_source":"pith","pith_arxiv_id":"2509.16591","snapshot_observed_at":"2026-07-10T14:27:07.370554Z","title":"Heterogeneous Adaptive Policy Optimization: Tailoring Optimization to Every Token's Nature","venue":"cs.CL","work_id":"cfba6900-dda2-48f5-bf23-d8cbf1d39a3a","year":2025},"citing_paper":{"arxiv_id":"2607.07976","last_updated":"2026-07-08T23:00:54Z","snapshot_observed_at":"2026-08-12T14:19:36.332471Z","submitted_at":"2026-07-08T23:00:54Z","title":"When Implausible Tokens Get Reinforced: Tail-Aware Credit Calibration for LLM Reinforcement Learning","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-07-10T14:25:07.006233Z"},"links":{"cited_paper":"/paper/2509.16591","citing_paper":"/paper/2607.07976"},"observation_digest":"sha256:c3c01f2b22621be8ac3ba4e0b4711ac067a0d1883579183ffe2c9e75b92b060d","observation_id":"d853adc5-ed7e-40fa-8fcc-0e2ba6282484","resolution":{"observed_at":"2026-07-10T14:27:07.371938Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T14:27:07.510745Z","title":"AMC23: American mathematics competitions 2023 test set","venue":null,"work_id":"56b53682-6b06-415b-b830-33ff04f3e940","year":2023},"citing_paper":{"arxiv_id":"2607.07976","last_updated":"2026-07-08T23:00:54Z","snapshot_observed_at":"2026-08-12T14:19:36.332471Z","submitted_at":"2026-07-08T23:00:54Z","title":"When Implausible Tokens Get Reinforced: Tail-Aware Credit Calibration for LLM Reinforcement Learning","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-07-10T14:25:07.006233Z"},"links":{"citing_paper":"/paper/2607.07976"},"observation_digest":"sha256:70984b978c5cb0273f5c96279ec6fea56549caa4097937b8cdcdb6e347107cb0","observation_id":"d5004d3a-3942-49af-8c16-a1ef2d2c52fc","resolution":{"observed_at":"2026-07-10T14:27:07.512049Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T14:27:07.516747Z","title":"Grpo- λ: Credit assignment improves llm reasoning, 2025","venue":null,"work_id":"fa96673f-eefe-4018-86b8-51c534b5bf53","year":2025},"citing_paper":{"arxiv_id":"2607.07976","last_updated":"2026-07-08T23:00:54Z","snapshot_observed_at":"2026-08-12T14:19:36.332471Z","submitted_at":"2026-07-08T23:00:54Z","title":"When Implausible Tokens Get Reinforced: Tail-Aware Credit Calibration for LLM Reinforcement Learning","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-07-10T14:25:07.006233Z"},"links":{"citing_paper":"/paper/2607.07976"},"observation_digest":"sha256:666e465abcbc03f4d66ee068bd6aa1f1ed5ef7b10f4391b05dd1a099b5f1cd5d","observation_id":"bf9449d8-30be-46c4-91ce-3ad63950abf8","resolution":{"observed_at":"2026-07-10T14:27:07.518110Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.12022","last_updated":"2023-11-20T18:57:34Z","snapshot_observed_at":"2026-08-18T14:12:03.598270Z","submitted_at":"2023-11-20T18:57:34Z","title":"GPQA: A Graduate-Level Google-Proof Q&A Benchmark","version":1},"cited_work":{"arxiv_id":"2311.12022","doi":"10.48550/arxiv.2311.12022","metadata_source":"pith","pith_arxiv_id":"2311.12022","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"GPQA: A Graduate-Level Google-Proof Q&A Benchmark","venue":"cs.AI","work_id":"9e2a976b-f5ad-4aee-af5c-243fe0fe75d2","year":2023},"citing_paper":{"arxiv_id":"2607.07976","last_updated":"2026-07-08T23:00:54Z","snapshot_observed_at":"2026-08-12T14:19:36.332471Z","submitted_at":"2026-07-08T23:00:54Z","title":"When Implausible Tokens Get Reinforced: Tail-Aware Credit Calibration for LLM Reinforcement Learning","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-07-10T14:25:07.006233Z"},"links":{"cited_paper":"/paper/2311.12022","citing_paper":"/paper/2607.07976"},"observation_digest":"sha256:b7891a63b37278ac0483eee67f5675a461e673b86a8985908dff86f03cb3c8c9","observation_id":"43e0cafc-c7ab-40f5-b264-040dd8c5f203","resolution":{"observed_at":"2026-07-10T14:27:07.384161Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-01T04:38:46.941438+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-01T04:38:46.941438+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-08-15T20:26:32.102285Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":"1707.06347","doi":"10.1016/j.artint.2010.12.005","metadata_source":"pith","pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Proximal Policy Optimization Algorithms","venue":"cs.LG","work_id":"240c67fe-d14d-4520-91c1-38a4e272ca19","year":2017},"citing_paper":{"arxiv_id":"2607.07976","last_updated":"2026-07-08T23:00:54Z","snapshot_observed_at":"2026-08-12T14:19:36.332471Z","submitted_at":"2026-07-08T23:00:54Z","title":"When Implausible Tokens Get Reinforced: Tail-Aware Credit Calibration for LLM Reinforcement Learning","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-07-10T14:25:07.006233Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2607.07976"},"observation_digest":"sha256:195df2336a5453d3187397524cfea3cc714c84d41a41a5b177db33ad92955783","observation_id":"6ab7f1fc-f10e-4e0c-a54e-7d8c23c246df","resolution":{"observed_at":"2026-07-10T14:27:07.366684Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2508.04349","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T14:27:07.358056Z","title":"Gtpo and grpo-s: Token and sequence-level reward shaping with policy entropy.arXiv preprint arXiv:2508.04349","venue":null,"work_id":"c337a3f9-8f7e-4f6a-b463-5f4193cee20b","year":2025},"citing_paper":{"arxiv_id":"2607.07976","last_updated":"2026-07-08T23:00:54Z","snapshot_observed_at":"2026-08-12T14:19:36.332471Z","submitted_at":"2026-07-08T23:00:54Z","title":"When Implausible Tokens Get Reinforced: Tail-Aware Credit Calibration for LLM Reinforcement Learning","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-07-10T14:25:07.006233Z"},"links":{"citing_paper":"/paper/2607.07976"},"observation_digest":"sha256:1fa2fee2ed89643eaac17768493d519d4a62cdc4b17570ef0425e9cd9adfbe0e","observation_id":"e66dfbd5-cc9b-494f-9305-edaa05cb4812","resolution":{"observed_at":"2026-07-10T14:27:07.360085Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T14:27:07.516380Z","title":"verl: V olcano engine reinforcement learning for llms","venue":null,"work_id":"4ae20b96-9778-4c02-914e-a1e02b7db19a","year":2024},"citing_paper":{"arxiv_id":"2607.07976","last_updated":"2026-07-08T23:00:54Z","snapshot_observed_at":"2026-08-12T14:19:36.332471Z","submitted_at":"2026-07-08T23:00:54Z","title":"When Implausible Tokens Get Reinforced: Tail-Aware Credit Calibration for LLM Reinforcement Learning","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-07-10T14:25:07.006233Z"},"links":{"citing_paper":"/paper/2607.07976"},"observation_digest":"sha256:6e7f7f483b74ccb1df5141ef1bbb39d6c8b61910db5567cd127df610fd8a9e6b","observation_id":"c4b2a6d7-bbc5-4613-9c20-d6e97f25b4ac","resolution":{"observed_at":"2026-07-10T14:27:07.517642Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T14:27:07.498324Z","title":"Mmlu-pro: A more robust and challenging multi-task language understanding benchmark","venue":null,"work_id":"1fa2936e-92bb-492e-bfb6-c61bd9bd1b3a","year":2024},"citing_paper":{"arxiv_id":"2607.07976","last_updated":"2026-07-08T23:00:54Z","snapshot_observed_at":"2026-08-12T14:19:36.332471Z","submitted_at":"2026-07-08T23:00:54Z","title":"When Implausible Tokens Get Reinforced: Tail-Aware Credit Calibration for LLM Reinforcement Learning","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-07-10T14:25:07.006233Z"},"links":{"citing_paper":"/paper/2607.07976"},"observation_digest":"sha256:ce409c81ccfe3619ebcd726a1a20c367327c840f3951a11564dd2d52eb05f1de","observation_id":"a476cc92-eedb-4256-9b16-207b25f08939","resolution":{"observed_at":"2026-07-10T14:27:07.499701Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T14:27:07.496383Z","title":"Neural text generation with unlikelihood training","venue":null,"work_id":"0caa69df-186d-4ad6-b03e-ace718564d7e","year":2020},"citing_paper":{"arxiv_id":"2607.07976","last_updated":"2026-07-08T23:00:54Z","snapshot_observed_at":"2026-08-12T14:19:36.332471Z","submitted_at":"2026-07-08T23:00:54Z","title":"When Implausible Tokens Get Reinforced: Tail-Aware Credit Calibration for LLM Reinforcement Learning","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-07-10T14:25:07.006233Z"},"links":{"citing_paper":"/paper/2607.07976"},"observation_digest":"sha256:932e17d554467632357940e000f5bff8f880a28ce942a98a01eacb64eae2fee4","observation_id":"dd27a7bb-7cf1-493e-a2b6-7b234622c20e","resolution":{"observed_at":"2026-07-10T14:27:07.497765Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T14:27:07.500292Z","title":"Self-ensemble: Mitigating confidence distortion for large language models","venue":null,"work_id":"e181bfb9-7038-4ba4-bdee-73b42508d402","year":2025},"citing_paper":{"arxiv_id":"2607.07976","last_updated":"2026-07-08T23:00:54Z","snapshot_observed_at":"2026-08-12T14:19:36.332471Z","submitted_at":"2026-07-08T23:00:54Z","title":"When Implausible Tokens Get Reinforced: Tail-Aware Credit Calibration for LLM Reinforcement Learning","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-07-10T14:25:07.006233Z"},"links":{"citing_paper":"/paper/2607.07976"},"observation_digest":"sha256:97ed2335668dcce9264c6d40dc69939bd96f6571a12764fa9cc97e1e05f9752a","observation_id":"8a490e27-cb6f-4625-a5fb-a8c44d8a8a0d","resolution":{"observed_at":"2026-07-10T14:27:07.501760Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T14:27:07.514967Z","title":null,"venue":null,"work_id":"03b2ed94-65b1-43ad-a5e8-b0f5c746c575","year":2025},"citing_paper":{"arxiv_id":"2607.07976","last_updated":"2026-07-08T23:00:54Z","snapshot_observed_at":"2026-08-12T14:19:36.332471Z","submitted_at":"2026-07-08T23:00:54Z","title":"When Implausible Tokens Get Reinforced: Tail-Aware Credit Calibration for LLM Reinforcement Learning","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-07-10T14:25:07.006233Z"},"links":{"citing_paper":"/paper/2607.07976"},"observation_digest":"sha256:633efd44fbd10d62ea98780a38a03fdfdab0c3286d0ac972ae678710cc342b87","observation_id":"226c4206-eba7-4215-ba25-34ba9a82457d","resolution":{"observed_at":"2026-07-10T14:27:07.516170Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2606.22305","last_updated":"2026-06-21T02:19:17Z","snapshot_observed_at":"2026-08-17T17:04:07.691142Z","submitted_at":"2026-06-21T02:19:17Z","title":"Learning at the Right Pace: Adaptive Data Scheduling Improves LLM Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2606.22305","doi":null,"metadata_source":"pith","pith_arxiv_id":"2606.22305","snapshot_observed_at":"2026-07-10T14:27:07.375901Z","title":"Learning at the Right Pace: Adaptive Data Scheduling Improves LLM Reinforcement Learning","venue":"cs.CL","work_id":"a7b2a380-d9b4-479b-be52-c508b755ebe3","year":2026},"citing_paper":{"arxiv_id":"2607.07976","last_updated":"2026-07-08T23:00:54Z","snapshot_observed_at":"2026-08-12T14:19:36.332471Z","submitted_at":"2026-07-08T23:00:54Z","title":"When Implausible Tokens Get Reinforced: Tail-Aware Credit Calibration for LLM Reinforcement Learning","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-07-10T14:25:07.006233Z"},"links":{"cited_paper":"/paper/2606.22305","citing_paper":"/paper/2607.07976"},"observation_digest":"sha256:27aefda9e0aa6a3f497bea571184796bda11bf63c7a4be491a3d8a7fef851505","observation_id":"e54299af-ac5a-4999-9d10-86526f99c937","resolution":{"observed_at":"2026-07-10T14:27:07.377916Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":"2505.09388","doi":"10.1016/j.aiopen.2022.12","metadata_source":"pith","pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Qwen3 Technical Report","venue":"cs.CL","work_id":"25a4e30c-1232-48e7-9925-02fa12ba7c9e","year":2025},"citing_paper":{"arxiv_id":"2607.07976","last_updated":"2026-07-08T23:00:54Z","snapshot_observed_at":"2026-08-12T14:19:36.332471Z","submitted_at":"2026-07-08T23:00:54Z","title":"When Implausible Tokens Get Reinforced: Tail-Aware Credit Calibration for LLM Reinforcement Learning","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-07-10T14:25:07.006233Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2607.07976"},"observation_digest":"sha256:16fb4b32cdc0f25eb2b21b923b4f179321ae55a7ace3654d384d0b706b3ba76d","observation_id":"be331791-00b3-4a40-975e-9490a234aa7a","resolution":{"observed_at":"2026-07-10T14:27:07.365296Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2601.14209","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T14:27:07.367238Z","title":"Int: Self-proposed interventions enable credit assignment in llm reasoning","venue":null,"work_id":"32156c79-bbf0-4b3a-8319-d728be4814e8","year":2026},"citing_paper":{"arxiv_id":"2607.07976","last_updated":"2026-07-08T23:00:54Z","snapshot_observed_at":"2026-08-12T14:19:36.332471Z","submitted_at":"2026-07-08T23:00:54Z","title":"When Implausible Tokens Get Reinforced: Tail-Aware Credit Calibration for LLM Reinforcement Learning","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-07-10T14:25:07.006233Z"},"links":{"citing_paper":"/paper/2607.07976"},"observation_digest":"sha256:362a6bc3d3fd796ab1f16144ca4e30e0c0fbfd5aa7f5a985e54169cca028c2f4","observation_id":"103c5305-bbf0-425a-91ae-708c593246de","resolution":{"observed_at":"2026-07-10T14:27:07.369395Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.12929","last_updated":"2025-05-19T10:14:08Z","snapshot_observed_at":"2026-08-17T12:38:18.871892Z","submitted_at":"2025-05-19T10:14:08Z","title":"Do Not Let Low-Probability Tokens Over-Dominate in RL for LLMs","version":1},"cited_work":{"arxiv_id":"2505.12929","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.12929","snapshot_observed_at":"2026-07-10T14:27:07.373132Z","title":"arXiv preprint arXiv:2505.12929 , year=","venue":"cs.CL","work_id":"965c4b96-d845-4417-bb01-9ec7fd03e93b","year":2025},"citing_paper":{"arxiv_id":"2607.07976","last_updated":"2026-07-08T23:00:54Z","snapshot_observed_at":"2026-08-12T14:19:36.332471Z","submitted_at":"2026-07-08T23:00:54Z","title":"When Implausible Tokens Get Reinforced: Tail-Aware Credit Calibration for LLM Reinforcement Learning","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-07-10T14:25:07.006233Z"},"links":{"cited_paper":"/paper/2505.12929","citing_paper":"/paper/2607.07976"},"observation_digest":"sha256:9cc4bff3688183219359637f8ea078fd9616530ca1d88d97955926f187aa2f50","observation_id":"de480b0e-a72d-4343-9e30-f44cbd760865","resolution":{"observed_at":"2026-07-10T14:27:07.374977Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T14:27:07.522779Z","title":"American invitational mathematics examination (AIME) 2024","venue":null,"work_id":"4c9005f1-7796-4f60-b41f-5fee2717e833","year":2024},"citing_paper":{"arxiv_id":"2607.07976","last_updated":"2026-07-08T23:00:54Z","snapshot_observed_at":"2026-08-12T14:19:36.332471Z","submitted_at":"2026-07-08T23:00:54Z","title":"When Implausible Tokens Get Reinforced: Tail-Aware Credit Calibration for LLM Reinforcement Learning","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-07-10T14:25:07.006233Z"},"links":{"citing_paper":"/paper/2607.07976"},"observation_digest":"sha256:299ea18b096a01f68d4051d2a59209c1af775e2b7a4d179242ba3417f9992715","observation_id":"552159d3-a99d-4695-b361-2ce62ababa40","resolution":{"observed_at":"2026-07-10T14:27:07.524036Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T14:27:07.511196Z","title":"American invitational mathematics examination (AIME) 2025","venue":null,"work_id":"015829c9-e4dc-4d0f-b381-89be24596f99","year":2025},"citing_paper":{"arxiv_id":"2607.07976","last_updated":"2026-07-08T23:00:54Z","snapshot_observed_at":"2026-08-12T14:19:36.332471Z","submitted_at":"2026-07-08T23:00:54Z","title":"When Implausible Tokens Get Reinforced: Tail-Aware Credit Calibration for LLM Reinforcement Learning","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-07-10T14:25:07.006233Z"},"links":{"citing_paper":"/paper/2607.07976"},"observation_digest":"sha256:f6b34aec0d74caace45fb365fd967be287d69fd63533b9dcd1b0322cff028528","observation_id":"f0ae9229-216b-4b9c-8ece-02462de4d7f8","resolution":{"observed_at":"2026-07-10T14:27:07.512495Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.18071","last_updated":"2025-07-28T11:11:33Z","snapshot_observed_at":"2026-08-15T00:49:38.146652Z","submitted_at":"2025-07-24T03:50:32Z","title":"Group Sequence Policy Optimization","version":2},"cited_work":{"arxiv_id":"2507.18071","doi":"10.48550/arxiv.2507.18071","metadata_source":"pith","pith_arxiv_id":"2507.18071","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Group Sequence Policy Optimization","venue":"cs.LG","work_id":"3a98b53b-9f52-4d95-adf7-89353c0a9a65","year":2025},"citing_paper":{"arxiv_id":"2607.07976","last_updated":"2026-07-08T23:00:54Z","snapshot_observed_at":"2026-08-12T14:19:36.332471Z","submitted_at":"2026-07-08T23:00:54Z","title":"When Implausible Tokens Get Reinforced: Tail-Aware Credit Calibration for LLM Reinforcement Learning","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-07-10T14:25:07.006233Z"},"links":{"cited_paper":"/paper/2507.18071","citing_paper":"/paper/2607.07976"},"observation_digest":"sha256:15f6bfc493db2983d344938abcd9320a8b247209e589a6701a874c566c425cb6","observation_id":"d144154f-0194-4292-88c3-3a36c45b58a6","resolution":{"observed_at":"2026-07-10T14:27:07.148343Z","resolver_source":"local_arxiv","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-15T03:08:21.960036+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-15T03:08:21.960036+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2607.07976","last_updated":"2026-07-08T23:00:54Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-12T14:19:36.332471Z","submitted_at":"2026-07-08T23:00:54Z","title":"When Implausible Tokens Get Reinforced: Tail-Aware Credit Calibration for LLM Reinforcement Learning"},"reference_resolution":{"displayed":27,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":1,"verified_exact":11,"verified_fuzzy":14},"total_outbound_references":27},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"thesis":"As of 19 August 2026, this Paper Citation Record lists 27 of 27 outbound references and 0 inbound Pith citation observations for arXiv:2607.07976."}