{"as_of":"2026-08-17T07:09:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:77c3e71345f52d5cc9bbb4bb3a009192490961c9a4cd14f6ded39fb06ebf047e","coverage":[{"denominator":25,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":25,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T10:20:20.407043Z","state":"measured"},{"denominator":26,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":26,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-17T06:30:58.91139+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-25T21:15:07.735336Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-04T19:30:07.857950Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2510.10541","last_updated":"2026-05-30T13:04:26Z","snapshot_observed_at":"2026-08-16T10:34:30.194579Z","submitted_at":"2025-10-12T10:49:57Z","title":"Rethinking RL Evaluation: Can Benchmarks Truly Reveal Failures of RL Methods?","version":2},"cited_work":{"arxiv_id":"2510.10541","doi":null,"metadata_source":"pith","pith_arxiv_id":"2510.10541","snapshot_observed_at":"2026-07-04T19:30:07.857950Z","title":"Rethinking RL Evaluation: Can Benchmarks Truly Reveal Failures of RL Methods?","venue":"cs.LG","work_id":"b113dc72-89b3-4a74-a074-ab6bf45ed274","year":2025},"citing_paper":{"arxiv_id":"2606.25527","last_updated":"2026-06-24T08:05:28Z","snapshot_observed_at":"2026-08-15T05:21:26.715125Z","submitted_at":"2026-06-24T08:05:28Z","title":"Beyond One-Size-Fits-All: Diagnosis-Driven Online Reinforcement Learning with Offline Priors","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-06-25T21:15:07.735336Z"},"links":{"cited_paper":"/paper/2510.10541","citing_paper":"/paper/2606.25527"},"observation_digest":"sha256:af300a720092937c3ab69188b508fdc4df867329b6caa5d4982d2cce2e65ae65","observation_id":"a8fbd985-0893-40d4-a625-a2a3988894ea","resolution":{"observed_at":"2026-07-04T19:30:07.859170Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2510.10541/citation-record","integrity":"/paper/2510.10541/integrity","json":"/paper/2510.10541/citation-record.json","paper":"/paper/2510.10541"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2110.14168","last_updated":"2021-11-18T00:23:45Z","snapshot_observed_at":"2026-08-14T02:43:01.480086Z","submitted_at":"2021-10-27T04:49:45Z","title":"Training Verifiers to Solve Math Word Problems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.14168","snapshot_observed_at":"2026-08-04T10:20:18.047448Z","title":"Training verifiers to solve math word problems","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2510.10541","last_updated":"2026-05-30T13:04:26Z","snapshot_observed_at":"2026-08-16T10:34:30.194579Z","submitted_at":"2025-10-12T10:49:57Z","title":"Rethinking RL Evaluation: Can Benchmarks Truly Reveal Failures of RL Methods?","version":2},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-04T10:20:18.047448Z"},"links":{"cited_paper":"/paper/2110.14168","citing_paper":"/paper/2510.10541"},"observation_digest":"sha256:44bf1cedbebf2124af777647c7efb90f529ad3f4b1f4c1ad42cdd82be1bd8904","observation_id":"4b1a2395-b57b-4d82-90e2-ecbfe2981f0c","resolution":{"observed_at":"2026-08-04T10:20:18.047448Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T10:20:18.121512Z","title":"Shortcut learning in deep neural networks","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2510.10541","last_updated":"2026-05-30T13:04:26Z","snapshot_observed_at":"2026-08-16T10:34:30.194579Z","submitted_at":"2025-10-12T10:49:57Z","title":"Rethinking RL Evaluation: Can Benchmarks Truly Reveal Failures of RL Methods?","version":2},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-04T10:20:18.121512Z"},"links":{"citing_paper":"/paper/2510.10541"},"observation_digest":"sha256:762d65e4578d85253ae755c348656f24318e4b940a3d0268f09edaf627211cff","observation_id":"3ed62fb8-7d48-44dc-98be-f3aef646042c","resolution":{"observed_at":"2026-08-04T10:20:18.121512Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T10:20:18.270251Z","title":"Measuring massive multitask language understanding","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2510.10541","last_updated":"2026-05-30T13:04:26Z","snapshot_observed_at":"2026-08-16T10:34:30.194579Z","submitted_at":"2025-10-12T10:49:57Z","title":"Rethinking RL Evaluation: Can Benchmarks Truly Reveal Failures of RL Methods?","version":2},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-04T10:20:18.270251Z"},"links":{"citing_paper":"/paper/2510.10541"},"observation_digest":"sha256:fee8fcbefc50d52b1ecaf0c0f6ce0e1ed4211fc7d262e9a819bcd877d01b0cb9","observation_id":"9a346905-9ddc-414e-bf1d-1a8080810ceb","resolution":{"observed_at":"2026-08-04T10:20:18.270251Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.07328","last_updated":"2017-07-23T18:26:29Z","snapshot_observed_at":"2026-08-14T20:45:52.185644Z","submitted_at":"2017-07-23T18:26:29Z","title":"Adversarial Examples for Evaluating Reading Comprehension Systems","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.07328","snapshot_observed_at":"2026-08-04T10:20:18.361180Z","title":"Adversarial examples for evaluating reading comprehension systems","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2510.10541","last_updated":"2026-05-30T13:04:26Z","snapshot_observed_at":"2026-08-16T10:34:30.194579Z","submitted_at":"2025-10-12T10:49:57Z","title":"Rethinking RL Evaluation: Can Benchmarks Truly Reveal Failures of RL Methods?","version":2},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-04T10:20:18.361180Z"},"links":{"cited_paper":"/paper/1707.07328","citing_paper":"/paper/2510.10541"},"observation_digest":"sha256:c2395a76d2f52c03238c3e67ece1ce9e60c0c4da16af69c3eb755d0eada54c7f","observation_id":"56a3c550-052d-4348-b875-16894bba678d","resolution":{"observed_at":"2026-08-04T10:20:18.361180Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2206.14858","last_updated":"2022-07-01T02:15:12Z","snapshot_observed_at":"2026-08-12T17:03:44.244933Z","submitted_at":"2022-06-29T18:54:49Z","title":"Solving Quantitative Reasoning Problems with Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.14858","snapshot_observed_at":"2026-08-04T10:20:18.458587Z","title":"Solving quantitative reasoning problems with language models, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2510.10541","last_updated":"2026-05-30T13:04:26Z","snapshot_observed_at":"2026-08-16T10:34:30.194579Z","submitted_at":"2025-10-12T10:49:57Z","title":"Rethinking RL Evaluation: Can Benchmarks Truly Reveal Failures of RL Methods?","version":2},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-04T10:20:18.458587Z"},"links":{"cited_paper":"/paper/2206.14858","citing_paper":"/paper/2510.10541"},"observation_digest":"sha256:ba81499a83c8b8b792b7c7011bddb2895258d77286e254b333be221760f26925","observation_id":"a6fa7254-93ae-453e-b732-8cbf73c1e452","resolution":{"observed_at":"2026-08-04T10:20:18.458587Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T10:20:18.524173Z","title":"Think or not think: A study of explicit thinking in rule-based visual reinforcement fine-tuning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.10541","last_updated":"2026-05-30T13:04:26Z","snapshot_observed_at":"2026-08-16T10:34:30.194579Z","submitted_at":"2025-10-12T10:49:57Z","title":"Rethinking RL Evaluation: Can Benchmarks Truly Reveal Failures of RL Methods?","version":2},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-04T10:20:18.524173Z"},"links":{"citing_paper":"/paper/2510.10541"},"observation_digest":"sha256:7d5293ca39a182b7f21be05c7bf22b6972f726d5105fe4e390285ec0d4a2abef","observation_id":"433ff859-2a4e-4de6-b343-f9853686de99","resolution":{"observed_at":"2026-08-04T10:20:18.524173Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T10:20:18.590115Z","title":"Let's verify step by step","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2510.10541","last_updated":"2026-05-30T13:04:26Z","snapshot_observed_at":"2026-08-16T10:34:30.194579Z","submitted_at":"2025-10-12T10:49:57Z","title":"Rethinking RL Evaluation: Can Benchmarks Truly Reveal Failures of RL Methods?","version":2},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-04T10:20:18.590115Z"},"links":{"citing_paper":"/paper/2510.10541"},"observation_digest":"sha256:9077fe8ba552b71fd878f1b6ac7065ffc58cfdaa4a891ef47d2e8b4e4195a5f3","observation_id":"ac220ade-97f4-47ec-ae94-9b163ee48c29","resolution":{"observed_at":"2026-08-04T10:20:18.590115Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T10:20:18.665265Z","title":"Deepscaler: Surpassing o1-preview with a 1.5 b model by scaling rl, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.10541","last_updated":"2026-05-30T13:04:26Z","snapshot_observed_at":"2026-08-16T10:34:30.194579Z","submitted_at":"2025-10-12T10:49:57Z","title":"Rethinking RL Evaluation: Can Benchmarks Truly Reveal Failures of RL Methods?","version":2},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-04T10:20:18.665265Z"},"links":{"citing_paper":"/paper/2510.10541"},"observation_digest":"sha256:e6c42ceb5821e07ac9a40ee4dc9b9fe853e893cc77c11c6d2b8a40ae692eb77d","observation_id":"0ec04a5c-12af-419c-a04b-721bdc6b9759","resolution":{"observed_at":"2026-08-04T10:20:18.665265Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T10:20:18.758528Z","title":"Training language models to follow instructions with human feedback","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2510.10541","last_updated":"2026-05-30T13:04:26Z","snapshot_observed_at":"2026-08-16T10:34:30.194579Z","submitted_at":"2025-10-12T10:49:57Z","title":"Rethinking RL Evaluation: Can Benchmarks Truly Reveal Failures of RL Methods?","version":2},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-04T10:20:18.758528Z"},"links":{"citing_paper":"/paper/2510.10541"},"observation_digest":"sha256:3a72bab663e45ac3e215c83610168939a949ac7b0c2d5da484c0e75b7c4c0931","observation_id":"cdbde81f-bb83-4466-8f7c-4181ea1a7913","resolution":{"observed_at":"2026-08-04T10:20:18.758528Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T10:20:18.878037Z","title":"Curriculum reinforcement learning from easy to hard tasks improves llm reasoning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.10541","last_updated":"2026-05-30T13:04:26Z","snapshot_observed_at":"2026-08-16T10:34:30.194579Z","submitted_at":"2025-10-12T10:49:57Z","title":"Rethinking RL Evaluation: Can Benchmarks Truly Reveal Failures of RL Methods?","version":2},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-04T10:20:18.878037Z"},"links":{"citing_paper":"/paper/2510.10541"},"observation_digest":"sha256:a0eba2403bbc023785667a55c353d5ad3f3cbb86463b7c5d3e868f269f1c368f","observation_id":"ebcd2427-c0b6-4803-bf06-5750abe77b37","resolution":{"observed_at":"2026-08-04T10:20:18.878037Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T10:20:18.993321Z","title":"Direct preference optimization: Your language model is secretly a reward model","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2510.10541","last_updated":"2026-05-30T13:04:26Z","snapshot_observed_at":"2026-08-16T10:34:30.194579Z","submitted_at":"2025-10-12T10:49:57Z","title":"Rethinking RL Evaluation: Can Benchmarks Truly Reveal Failures of RL Methods?","version":2},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-04T10:20:18.993321Z"},"links":{"citing_paper":"/paper/2510.10541"},"observation_digest":"sha256:94186912b2faf2d8bd480e8f31cf4fec9430cf5e511157eb0d87309de4015529","observation_id":"db9d3758-fb1d-40ca-a4a0-5cb6970d7162","resolution":{"observed_at":"2026-08-04T10:20:18.993321Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-08-15T20:26:32.102285Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-04T10:20:19.123246Z","title":"Proximal policy optimization algorithms","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2510.10541","last_updated":"2026-05-30T13:04:26Z","snapshot_observed_at":"2026-08-16T10:34:30.194579Z","submitted_at":"2025-10-12T10:49:57Z","title":"Rethinking RL Evaluation: Can Benchmarks Truly Reveal Failures of RL Methods?","version":2},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-04T10:20:19.123246Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2510.10541"},"observation_digest":"sha256:6b8e37e521bc8ad692a9f3cefeef33c50ea40a961dc77087740c0ad8ee5fb664","observation_id":"983eeed1-c37b-46be-919d-6036b7315bb1","resolution":{"observed_at":"2026-08-04T10:20:19.123246Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-04T10:20:19.245701Z","title":"Deepseekmath: Pushing the limits of mathematical reasoning in open language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.10541","last_updated":"2026-05-30T13:04:26Z","snapshot_observed_at":"2026-08-16T10:34:30.194579Z","submitted_at":"2025-10-12T10:49:57Z","title":"Rethinking RL Evaluation: Can Benchmarks Truly Reveal Failures of RL Methods?","version":2},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-04T10:20:19.245701Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2510.10541"},"observation_digest":"sha256:843dca3b8ff1df67eb14717014d1d47e99e37cbd4c96fd9ac320b0851eb07877","observation_id":"747ce24d-dcb6-4120-835c-625de9a36168","resolution":{"observed_at":"2026-08-04T10:20:19.245701Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1906.04701","last_updated":"2019-06-11T17:06:49Z","snapshot_observed_at":"2026-08-14T16:17:19.904545Z","submitted_at":"2019-06-11T17:06:49Z","title":"HEAD-QA: A Healthcare Dataset for Complex Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1906.04701","snapshot_observed_at":"2026-08-04T10:20:19.327712Z","title":"Head-qa: A healthcare dataset for complex reasoning","venue":null,"work_id":null,"year":1906},"citing_paper":{"arxiv_id":"2510.10541","last_updated":"2026-05-30T13:04:26Z","snapshot_observed_at":"2026-08-16T10:34:30.194579Z","submitted_at":"2025-10-12T10:49:57Z","title":"Rethinking RL Evaluation: Can Benchmarks Truly Reveal Failures of RL Methods?","version":2},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-04T10:20:19.327712Z"},"links":{"cited_paper":"/paper/1906.04701","citing_paper":"/paper/2510.10541"},"observation_digest":"sha256:e632abe6e310e682467b786e203666c4d3371c8c991c0da75e27f84ffe129c0c","observation_id":"47e73c85-0fb2-4f3b-a262-063dcc4ff5a1","resolution":{"observed_at":"2026-08-04T10:20:19.327712Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.11171","last_updated":"2023-03-07T17:57:37Z","snapshot_observed_at":"2026-08-16T01:49:22.176843Z","submitted_at":"2022-03-21T17:48:52Z","title":"Self-Consistency Improves Chain of Thought Reasoning in Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.11171","snapshot_observed_at":"2026-08-04T10:20:19.428770Z","title":"Self-consistency improves chain of thought reasoning in language models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2510.10541","last_updated":"2026-05-30T13:04:26Z","snapshot_observed_at":"2026-08-16T10:34:30.194579Z","submitted_at":"2025-10-12T10:49:57Z","title":"Rethinking RL Evaluation: Can Benchmarks Truly Reveal Failures of RL Methods?","version":2},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-04T10:20:19.428770Z"},"links":{"cited_paper":"/paper/2203.11171","citing_paper":"/paper/2510.10541"},"observation_digest":"sha256:fbc29a4f8dfecf1e611821a33e1212609c4263afcf992816388da0c8c7c8bc42","observation_id":"e01159f6-6375-4e28-975d-3c8078019ee7","resolution":{"observed_at":"2026-08-04T10:20:19.428770Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T10:20:19.588462Z","title":"Chain-of-thought prompting elicits reasoning in large language models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2510.10541","last_updated":"2026-05-30T13:04:26Z","snapshot_observed_at":"2026-08-16T10:34:30.194579Z","submitted_at":"2025-10-12T10:49:57Z","title":"Rethinking RL Evaluation: Can Benchmarks Truly Reveal Failures of RL Methods?","version":2},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-04T10:20:19.588462Z"},"links":{"citing_paper":"/paper/2510.10541"},"observation_digest":"sha256:e4f1e7f8de13613e6670494980ebfb836f087f5857cb1f99b2d73aea6d5bf42c","observation_id":"5f1baf7b-1d70-40de-a153-53e171474b09","resolution":{"observed_at":"2026-08-04T10:20:19.588462Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.10601","last_updated":"2023-12-03T22:50:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-05-17T23:16:17Z","title":"Tree of Thoughts: Deliberate Problem Solving with Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.10601","snapshot_observed_at":"2026-08-04T10:20:19.721870Z","title":"Tree of thoughts: Deliberate problem solving with large language models, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2510.10541","last_updated":"2026-05-30T13:04:26Z","snapshot_observed_at":"2026-08-16T10:34:30.194579Z","submitted_at":"2025-10-12T10:49:57Z","title":"Rethinking RL Evaluation: Can Benchmarks Truly Reveal Failures of RL Methods?","version":2},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-04T10:20:19.721870Z"},"links":{"cited_paper":"/paper/2305.10601","citing_paper":"/paper/2510.10541"},"observation_digest":"sha256:89b9ba516c6a97002e16c525df8c7facd5b86d69502bd6f86ccb2b25662d27eb","observation_id":"9c7ad0c6-f9cd-4d50-9f3f-88f64a9e3845","resolution":{"observed_at":"2026-08-04T10:20:19.721870Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T10:20:19.865669Z","title":"Frame: Feedback-refined agent methodology for enhancing medical research insights","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.10541","last_updated":"2026-05-30T13:04:26Z","snapshot_observed_at":"2026-08-16T10:34:30.194579Z","submitted_at":"2025-10-12T10:49:57Z","title":"Rethinking RL Evaluation: Can Benchmarks Truly Reveal Failures of RL Methods?","version":2},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-04T10:20:19.865669Z"},"links":{"citing_paper":"/paper/2510.10541"},"observation_digest":"sha256:90456a2c846b68d97e470578f99c3eb836eaad6323a1362e8bb17695ab4327b6","observation_id":"e7fc6145-cb8b-4ef3-9e68-4cf5b78681d8","resolution":{"observed_at":"2026-08-04T10:20:19.865669Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.18892","last_updated":"2025-08-06T08:42:32Z","snapshot_observed_at":"2026-07-06T20:57:57.039376Z","submitted_at":"2025-03-24T17:06:10Z","title":"SimpleRL-Zoo: Investigating and Taming Zero Reinforcement Learning for Open Base Models in the Wild","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.18892","snapshot_observed_at":"2026-08-04T10:20:19.991179Z","title":"Simplerl-zoo: Investigating and taming zero reinforcement learning for open base models in the wild","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.10541","last_updated":"2026-05-30T13:04:26Z","snapshot_observed_at":"2026-08-16T10:34:30.194579Z","submitted_at":"2025-10-12T10:49:57Z","title":"Rethinking RL Evaluation: Can Benchmarks Truly Reveal Failures of RL Methods?","version":2},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-04T10:20:19.991179Z"},"links":{"cited_paper":"/paper/2503.18892","citing_paper":"/paper/2510.10541"},"observation_digest":"sha256:6cb5e082cfed41842a4d26f35c0b75285eb45e9e92697d771882e508a833b098","observation_id":"d3795470-4370-46d5-9301-1677b24c1bc2","resolution":{"observed_at":"2026-08-04T10:20:19.991179Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.13372","last_updated":"2024-06-27T22:44:48Z","snapshot_observed_at":"2026-08-17T02:51:06.474773Z","submitted_at":"2024-03-20T08:08:54Z","title":"LlamaFactory: Unified Efficient Fine-Tuning of 100+ Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.13372","snapshot_observed_at":"2026-08-04T10:20:20.043540Z","title":"Llamafactory: Unified efficient fine-tuning of 100+ language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.10541","last_updated":"2026-05-30T13:04:26Z","snapshot_observed_at":"2026-08-16T10:34:30.194579Z","submitted_at":"2025-10-12T10:49:57Z","title":"Rethinking RL Evaluation: Can Benchmarks Truly Reveal Failures of RL Methods?","version":2},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-04T10:20:20.043540Z"},"links":{"cited_paper":"/paper/2403.13372","citing_paper":"/paper/2510.10541"},"observation_digest":"sha256:e15249668bfb80d6468a4db17958ea75e0da6c5f9155e77b14b7f48c5b01690f","observation_id":"664256ce-62d2-4b7a-9711-f17a87d68503","resolution":{"observed_at":"2026-08-04T10:20:20.043540Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T10:20:20.091347Z","title":"Easyr1: An efficient, scalable, multi-modality rl training framework","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.10541","last_updated":"2026-05-30T13:04:26Z","snapshot_observed_at":"2026-08-16T10:34:30.194579Z","submitted_at":"2025-10-12T10:49:57Z","title":"Rethinking RL Evaluation: Can Benchmarks Truly Reveal Failures of RL Methods?","version":2},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-04T10:20:20.091347Z"},"links":{"citing_paper":"/paper/2510.10541"},"observation_digest":"sha256:7adcd7a64519c987afe58a314532532a7c434b61a4aa5ff84f37cae3a7a0dbaf","observation_id":"85245822-8158-4d77-a0bb-7676a8d9b49a","resolution":{"observed_at":"2026-08-04T10:20:20.091347Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T10:20:20.207076Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.10541","last_updated":"2026-05-30T13:04:26Z","snapshot_observed_at":"2026-08-16T10:34:30.194579Z","submitted_at":"2025-10-12T10:49:57Z","title":"Rethinking RL Evaluation: Can Benchmarks Truly Reveal Failures of RL Methods?","version":2},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-04T10:20:20.207076Z"},"links":{"citing_paper":"/paper/2510.10541"},"observation_digest":"sha256:7c16c60b1235dd224bfc64defebdc46717053d2a508e93df290cfdf1f70487c9","observation_id":"af54b007-148c-4ebc-bc7c-6ce0efd556a9","resolution":{"observed_at":"2026-08-04T10:20:20.207076Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T10:20:20.302554Z","title":"@esa (Ref","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.10541","last_updated":"2026-05-30T13:04:26Z","snapshot_observed_at":"2026-08-16T10:34:30.194579Z","submitted_at":"2025-10-12T10:49:57Z","title":"Rethinking RL Evaluation: Can Benchmarks Truly Reveal Failures of RL Methods?","version":2},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-04T10:20:20.302554Z"},"links":{"citing_paper":"/paper/2510.10541"},"observation_digest":"sha256:345c4367dbcf9b79d1007fb78b8fe2f0c2753998f1d820d9543845b7a51d0ff3","observation_id":"32270c72-0952-4a5f-aea5-d7edcf434404","resolution":{"observed_at":"2026-08-04T10:20:20.302554Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T10:20:20.377723Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.10541","last_updated":"2026-05-30T13:04:26Z","snapshot_observed_at":"2026-08-16T10:34:30.194579Z","submitted_at":"2025-10-12T10:49:57Z","title":"Rethinking RL Evaluation: Can Benchmarks Truly Reveal Failures of RL Methods?","version":2},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-04T10:20:20.377723Z"},"links":{"citing_paper":"/paper/2510.10541"},"observation_digest":"sha256:14f090f506574fb87ca79ee9ed52138d8cdcc756c4bfff1df7dffd14186b753a","observation_id":"700a9b75-6981-47c6-ba3c-aea8b9ed55e9","resolution":{"observed_at":"2026-08-04T10:20:20.377723Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T10:20:20.407043Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.10541","last_updated":"2026-05-30T13:04:26Z","snapshot_observed_at":"2026-08-16T10:34:30.194579Z","submitted_at":"2025-10-12T10:49:57Z","title":"Rethinking RL Evaluation: Can Benchmarks Truly Reveal Failures of RL Methods?","version":2},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-04T10:20:20.407043Z"},"links":{"citing_paper":"/paper/2510.10541"},"observation_digest":"sha256:4fd1ef232142396c23fde69132723be5fcd6f239b69d34d30cc6991419044987","observation_id":"ce937af4-a397-4290-9587-029f73a6da46","resolution":{"observed_at":"2026-08-04T10:20:20.407043Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2510.10541","last_updated":"2026-05-30T13:04:26Z","latest_version":2,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-16T10:34:30.194579Z","submitted_at":"2025-10-12T10:49:57Z","title":"Rethinking RL Evaluation: Can Benchmarks Truly Reveal Failures of RL Methods?"},"reference_resolution":{"displayed":25,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":25,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":25},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"thesis":"As of 17 August 2026, this Paper Citation Record lists 25 of 25 outbound references and 1 inbound Pith citation observation for arXiv:2510.10541."}