{"as_of":"2026-08-09T08:21:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:a699ccf7ab94bfbcbca5006dc2807f96795adc08bcc8abb3b966274c6a56c67c","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":41,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":41,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":41,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":41,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T15:25:48.065006Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T09:59:44.665948Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2503.07572","last_updated":"2025-03-10T17:40:43Z","snapshot_observed_at":"2026-08-07T17:16:00.148793Z","submitted_at":"2025-03-10T17:40:43Z","title":"Optimizing Test-Time Compute via Meta Reinforcement Fine-Tuning","version":1},"cited_work":{"arxiv_id":"2503.07572","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.07572","snapshot_observed_at":"2026-07-04T09:59:44.665948Z","title":"Y ., Setlur, A., Tunstall, L., Beeching, E","venue":null,"work_id":"752e721a-05b7-48c9-9395-60c1f280bd2f","year":2025},"citing_paper":{"arxiv_id":"2503.16419","last_updated":"2025-08-21T19:14:40Z","snapshot_observed_at":"2026-08-07T04:27:23.738927Z","submitted_at":"2025-03-20T17:59:38Z","title":"Stop Overthinking: A Survey on Efficient Reasoning for Large Language Models","version":4},"reference_index":146,"source":"pdf_text","source_observed_at":"2026-05-14T01:29:56.480020Z"},"links":{"cited_paper":"/paper/2503.07572","citing_paper":"/paper/2503.16419"},"observation_digest":"sha256:e73a20a7339f754de42dc5cdb00465f2ceadc804e6cb62dbc2b232e66b871520","observation_id":"48f99603-5474-42f5-b4f9-e763540754af","resolution":{"observed_at":"2026-05-14T01:29:56.717777Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.07572","last_updated":"2025-03-10T17:40:43Z","snapshot_observed_at":"2026-08-07T17:16:00.148793Z","submitted_at":"2025-03-10T17:40:43Z","title":"Optimizing Test-Time Compute via Meta Reinforcement Fine-Tuning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.07572","snapshot_observed_at":"2026-08-07T15:25:48.065006Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.15276","last_updated":"2025-05-21T08:55:35Z","snapshot_observed_at":"2026-08-07T19:18:47.764118Z","submitted_at":"2025-05-21T08:55:35Z","title":"When Can Large Reasoning Models Save Thinking? Mechanistic Analysis of Behavioral Divergence in Reasoning","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-07T15:25:48.065006Z"},"links":{"cited_paper":"/paper/2503.07572","citing_paper":"/paper/2505.15276"},"observation_digest":"sha256:94afe5c82760cb54a2d6523951d8a60be16aa3ce1827da98f7f9c8d770175ca4","observation_id":"67d9088e-a32b-4723-8867-4a9ef489ad46","resolution":{"observed_at":"2026-08-07T15:25:48.065006Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.07572","last_updated":"2025-03-10T17:40:43Z","snapshot_observed_at":"2026-08-07T17:16:00.148793Z","submitted_at":"2025-03-10T17:40:43Z","title":"Optimizing Test-Time Compute via Meta Reinforcement Fine-Tuning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.07572","snapshot_observed_at":"2026-08-07T15:17:52.237254Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.15684","last_updated":"2025-05-23T11:59:22Z","snapshot_observed_at":"2026-08-07T22:37:54.918839Z","submitted_at":"2025-05-21T15:58:16Z","title":"ThinkLess: A Training-Free Inference-Efficient Method for Reducing Reasoning Redundancy","version":2},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-07T15:17:52.237254Z"},"links":{"cited_paper":"/paper/2503.07572","citing_paper":"/paper/2505.15684"},"observation_digest":"sha256:b91f86b9501e43354bfa5fe50580e954fb8fe7ad92da41ab7d6810b7df3fbd4c","observation_id":"1d92f2bc-acec-4275-80f0-22abdc1e0a66","resolution":{"observed_at":"2026-08-07T15:17:52.237254Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.07572","last_updated":"2025-03-10T17:40:43Z","snapshot_observed_at":"2026-08-07T17:16:00.148793Z","submitted_at":"2025-03-10T17:40:43Z","title":"Optimizing Test-Time Compute via Meta Reinforcement Fine-Tuning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.07572","snapshot_observed_at":"2026-08-07T14:37:46.502834Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.18121","last_updated":"2025-05-23T17:23:11Z","snapshot_observed_at":"2026-08-08T03:09:00.063180Z","submitted_at":"2025-05-23T17:23:11Z","title":"ProgRM: Build Better GUI Agents with Progress Rewards","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T14:37:46.502834Z"},"links":{"cited_paper":"/paper/2503.07572","citing_paper":"/paper/2505.18121"},"observation_digest":"sha256:6dce20724086139ad3a70eb24a00724bd31f17c37e6a7b191756752ad1dcf92d","observation_id":"18d80b30-3761-4e5e-b55e-c5e36827d8ce","resolution":{"observed_at":"2026-08-07T14:37:46.502834Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.07572","last_updated":"2025-03-10T17:40:43Z","snapshot_observed_at":"2026-08-07T17:16:00.148793Z","submitted_at":"2025-03-10T17:40:43Z","title":"Optimizing Test-Time Compute via Meta Reinforcement Fine-Tuning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.07572","snapshot_observed_at":"2026-08-07T13:58:36.490897Z","title":"Optimizing test-time compute via meta reinforcement fine-tuning.arXiv preprint arXiv:2503.07572, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.20522","last_updated":"2025-06-07T22:18:32Z","snapshot_observed_at":"2026-08-07T13:50:26.001759Z","submitted_at":"2025-05-26T20:58:45Z","title":"Scaling over Scaling: Exploring Test-Time Scaling Plateau in Large Reasoning Models","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T13:58:36.490897Z"},"links":{"cited_paper":"/paper/2503.07572","citing_paper":"/paper/2505.20522"},"observation_digest":"sha256:7598cb903f5423606cfafaf46fd4f0bb3bca797cfa698c6e3d0d96d8fa900511","observation_id":"3eff9656-260f-4662-8891-409e8e3b4b38","resolution":{"observed_at":"2026-08-07T13:58:36.490897Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.07572","last_updated":"2025-03-10T17:40:43Z","snapshot_observed_at":"2026-08-07T17:16:00.148793Z","submitted_at":"2025-03-10T17:40:43Z","title":"Optimizing Test-Time Compute via Meta Reinforcement Fine-Tuning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.07572","snapshot_observed_at":"2026-08-07T13:53:03.913311Z","title":"Optimizing test-time compute via meta reinforcement fine-tuning.arXiv preprint arXiv:2503.07572, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.20732","last_updated":"2025-05-27T05:21:04Z","snapshot_observed_at":"2026-08-07T13:45:29.055916Z","submitted_at":"2025-05-27T05:21:04Z","title":"SPA-RL: Reinforcing LLM Agents via Stepwise Progress Attribution","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:03.913311Z"},"links":{"cited_paper":"/paper/2503.07572","citing_paper":"/paper/2505.20732"},"observation_digest":"sha256:60e7984532ad9b3a1b560c4dda5de8de9a16e1c40f2c96dbc6932fcc6769f035","observation_id":"ca712478-cdd0-4219-a452-36072aac2daf","resolution":{"observed_at":"2026-08-07T13:53:03.913311Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.07572","last_updated":"2025-03-10T17:40:43Z","snapshot_observed_at":"2026-08-07T17:16:00.148793Z","submitted_at":"2025-03-10T17:40:43Z","title":"Optimizing Test-Time Compute via Meta Reinforcement Fine-Tuning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.07572","snapshot_observed_at":"2026-08-07T13:30:21.577160Z","title":"Optimizing test-time compute via meta reinforcement fine-tuning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.21765","last_updated":"2025-05-27T20:59:29Z","snapshot_observed_at":"2026-08-08T03:33:47.797238Z","submitted_at":"2025-05-27T20:59:29Z","title":"Don't Think Longer, Think Wisely: Optimizing Thinking Dynamics for Large Reasoning Models","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T13:30:21.577160Z"},"links":{"cited_paper":"/paper/2503.07572","citing_paper":"/paper/2505.21765"},"observation_digest":"sha256:67f8c31360d8e0bf999b538b11093846751e61cf080c6ccb0571f15228a6bf2b","observation_id":"523b62c2-f102-40f1-9ae0-22fbd4ff1678","resolution":{"observed_at":"2026-08-07T13:30:21.577160Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.07572","last_updated":"2025-03-10T17:40:43Z","snapshot_observed_at":"2026-08-07T17:16:00.148793Z","submitted_at":"2025-03-10T17:40:43Z","title":"Optimizing Test-Time Compute via Meta Reinforcement Fine-Tuning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.07572","snapshot_observed_at":"2026-08-07T12:35:29.461138Z","title":"Y., Setlur, A., Tunstall, L., Beeching, E","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.24584","last_updated":"2025-08-18T16:52:22Z","snapshot_observed_at":"2026-08-07T23:11:32.031898Z","submitted_at":"2025-05-30T13:32:00Z","title":"AutoChemSchematic AI: Agentic Physics-Aware Automation for Chemical Manufacturing Scale-Up","version":3},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-07T12:35:29.461138Z"},"links":{"cited_paper":"/paper/2503.07572","citing_paper":"/paper/2505.24584"},"observation_digest":"sha256:fab52497a2248340ecd2d045acf6dc366918a9e1adefaa71d9703ab8085263dd","observation_id":"7ffc267b-be9d-44f8-bf7a-2c865a31dcf0","resolution":{"observed_at":"2026-08-07T12:35:29.461138Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.07572","last_updated":"2025-03-10T17:40:43Z","snapshot_observed_at":"2026-08-07T17:16:00.148793Z","submitted_at":"2025-03-10T17:40:43Z","title":"Optimizing Test-Time Compute via Meta Reinforcement Fine-Tuning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.07572","snapshot_observed_at":"2026-08-07T12:35:43.664836Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.24863","last_updated":"2025-05-30T17:58:36Z","snapshot_observed_at":"2026-08-07T20:38:56.380571Z","submitted_at":"2025-05-30T17:58:36Z","title":"AlphaOne: Reasoning Models Thinking Slow and Fast at Test Time","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-07T12:35:43.664836Z"},"links":{"cited_paper":"/paper/2503.07572","citing_paper":"/paper/2505.24863"},"observation_digest":"sha256:27fec4b50f4f6b6efafde667ef72cc8b7d5f1663153e3c2db38d5535db36f2b7","observation_id":"95308d0d-230e-4fb2-9a55-11b1e9187da4","resolution":{"observed_at":"2026-08-07T12:35:43.664836Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.07572","last_updated":"2025-03-10T17:40:43Z","snapshot_observed_at":"2026-08-07T17:16:00.148793Z","submitted_at":"2025-03-10T17:40:43Z","title":"Optimizing Test-Time Compute via Meta Reinforcement Fine-Tuning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.07572","snapshot_observed_at":"2026-08-07T10:42:40.992654Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.04611","last_updated":"2025-06-05T04:02:17Z","snapshot_observed_at":"2026-08-07T13:54:09.003484Z","submitted_at":"2025-06-05T04:02:17Z","title":"Revisiting Test-Time Scaling: A Survey and a Diversity-Aware Method for Efficient Reasoning","version":1},"reference_index":68,"source":"arxiv_source","source_observed_at":"2026-08-07T10:42:40.992654Z"},"links":{"cited_paper":"/paper/2503.07572","citing_paper":"/paper/2506.04611"},"observation_digest":"sha256:f0dcb17e8b753340563715925b6726ce3981a1d6d33eb15f6cb023039b3b906e","observation_id":"5ece831f-5459-469e-af83-01d6f0ccb08a","resolution":{"observed_at":"2026-08-07T10:42:40.992654Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.07572","last_updated":"2025-03-10T17:40:43Z","snapshot_observed_at":"2026-08-07T17:16:00.148793Z","submitted_at":"2025-03-10T17:40:43Z","title":"Optimizing Test-Time Compute via Meta Reinforcement Fine-Tuning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.07572","snapshot_observed_at":"2026-08-07T10:35:37.612022Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.05295","last_updated":"2025-06-12T16:25:06Z","snapshot_observed_at":"2026-08-09T06:08:18.122150Z","submitted_at":"2025-06-05T17:48:19Z","title":"Sample Complexity and Representation Ability of Test-time Scaling Paradigms","version":2},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-07T10:35:37.612022Z"},"links":{"cited_paper":"/paper/2503.07572","citing_paper":"/paper/2506.05295"},"observation_digest":"sha256:1be424b3229156d01af25708873163434c44f122ee32a7aedafeb997ee380867","observation_id":"c2f3e066-ffe6-42d3-8866-d5cb62a0cfe3","resolution":{"observed_at":"2026-08-07T10:35:37.612022Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.07572","last_updated":"2025-03-10T17:40:43Z","snapshot_observed_at":"2026-08-07T17:16:00.148793Z","submitted_at":"2025-03-10T17:40:43Z","title":"Optimizing Test-Time Compute via Meta Reinforcement Fine-Tuning","version":1},"cited_work":{"arxiv_id":"2503.07572","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.07572","snapshot_observed_at":"2026-07-04T09:59:44.665948Z","title":"Y ., Setlur, A., Tunstall, L., Beeching, E","venue":null,"work_id":"752e721a-05b7-48c9-9395-60c1f280bd2f","year":2025},"citing_paper":{"arxiv_id":"2506.06941","last_updated":"2025-11-20T00:19:24Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-07T22:42:29Z","title":"The Illusion of Thinking: Understanding the Strengths and Limitations of Reasoning Models via the Lens of Problem Complexity","version":3},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-15T16:10:31.440921Z"},"links":{"cited_paper":"/paper/2503.07572","citing_paper":"/paper/2506.06941"},"observation_digest":"sha256:01ba903ffbe8084ce13a3f3f592ce821ae555b13845e5238d293ba1e1e6fa679","observation_id":"1dde6b51-6090-42df-b014-a3bd8579b19a","resolution":{"observed_at":"2026-05-15T16:10:31.523933Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.07572","last_updated":"2025-03-10T17:40:43Z","snapshot_observed_at":"2026-08-07T17:16:00.148793Z","submitted_at":"2025-03-10T17:40:43Z","title":"Optimizing Test-Time Compute via Meta Reinforcement Fine-Tuning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.07572","snapshot_observed_at":"2026-08-07T05:49:38.378369Z","title":"Optimizing test-time compute via meta reinforcement fine-tuning.arXiv preprint arXiv:2503.07572, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.07104","last_updated":"2025-09-10T09:03:04Z","snapshot_observed_at":"2026-08-07T16:09:05.593491Z","submitted_at":"2025-06-08T12:18:50Z","title":"How Far Are We from Optimal Reasoning Efficiency?","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T05:49:38.378369Z"},"links":{"cited_paper":"/paper/2503.07572","citing_paper":"/paper/2506.07104"},"observation_digest":"sha256:1c49384948d6603083b2bae219470c69cd101dbe50f93116f783a45b6a093c0c","observation_id":"3b642e89-0914-4e15-873d-ee3d7fab022d","resolution":{"observed_at":"2026-08-07T05:49:38.378369Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.07572","last_updated":"2025-03-10T17:40:43Z","snapshot_observed_at":"2026-08-07T17:16:00.148793Z","submitted_at":"2025-03-10T17:40:43Z","title":"Optimizing Test-Time Compute via Meta Reinforcement Fine-Tuning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.07572","snapshot_observed_at":"2026-08-07T05:27:50.229084Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.07976","last_updated":"2025-06-10T12:50:18Z","snapshot_observed_at":"2026-08-07T20:50:35.036523Z","submitted_at":"2025-06-09T17:50:02Z","title":"Thinking vs. Doing: Agents that Reason by Scaling Test-Time Interaction","version":2},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-07T05:27:50.229084Z"},"links":{"cited_paper":"/paper/2503.07572","citing_paper":"/paper/2506.07976"},"observation_digest":"sha256:a9860c91347315d2bf8314e16a2449457ef7f82f7b61138c856c98fe358e3fe4","observation_id":"8d2ad100-cff4-41f3-bf36-373daa431c22","resolution":{"observed_at":"2026-08-07T05:27:50.229084Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.07572","last_updated":"2025-03-10T17:40:43Z","snapshot_observed_at":"2026-08-07T17:16:00.148793Z","submitted_at":"2025-03-10T17:40:43Z","title":"Optimizing Test-Time Compute via Meta Reinforcement Fine-Tuning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.07572","snapshot_observed_at":"2026-08-07T05:03:27.410502Z","title":"Optimizing test-time compute via meta reinforcement fine-tuning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.09026","last_updated":"2025-06-13T17:44:03Z","snapshot_observed_at":"2026-08-09T06:45:47.107738Z","submitted_at":"2025-06-10T17:52:42Z","title":"e3: Learning to Explore Enables Extrapolation of Test-Time Compute for LLMs","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T05:03:27.410502Z"},"links":{"cited_paper":"/paper/2503.07572","citing_paper":"/paper/2506.09026"},"observation_digest":"sha256:b1167f2feebe3d0c8f44324b9b3745fa71f4f30b57bee68149720d4988f313a7","observation_id":"83245270-4548-4a11-8767-ddf00921963f","resolution":{"observed_at":"2026-08-07T05:03:27.410502Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.07572","last_updated":"2025-03-10T17:40:43Z","snapshot_observed_at":"2026-08-07T17:16:00.148793Z","submitted_at":"2025-03-10T17:40:43Z","title":"Optimizing Test-Time Compute via Meta Reinforcement Fine-Tuning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.07572","snapshot_observed_at":"2026-08-07T04:39:19.223327Z","title":"Optimizing test-time compute via meta reinforcement fine-tuning.arXiv preprint arXiv:2503.07572,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.10341","last_updated":"2026-06-06T22:57:41Z","snapshot_observed_at":"2026-08-09T00:47:01.008665Z","submitted_at":"2025-06-12T04:35:02Z","title":"Formalizing Learning from Language Feedback with Provable Guarantees","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T04:39:19.223327Z"},"links":{"cited_paper":"/paper/2503.07572","citing_paper":"/paper/2506.10341"},"observation_digest":"sha256:3f8f25e52a7522d54d21a7b4d49fec933873e3c45dc77cc3bb59242fea8dc7c1","observation_id":"4594d305-d6ef-4987-a7ea-12d9132564ab","resolution":{"observed_at":"2026-08-07T04:39:19.223327Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.07572","last_updated":"2025-03-10T17:40:43Z","snapshot_observed_at":"2026-08-07T17:16:00.148793Z","submitted_at":"2025-03-10T17:40:43Z","title":"Optimizing Test-Time Compute via Meta Reinforcement Fine-Tuning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.07572","snapshot_observed_at":"2026-08-07T04:38:09.500490Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.10446","last_updated":"2025-06-12T07:49:24Z","snapshot_observed_at":"2026-08-07T08:57:21.082572Z","submitted_at":"2025-06-12T07:49:24Z","title":"Fast on the Easy, Deep on the Hard: Efficient Reasoning via Powered Length Penalty","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-07T04:38:09.500490Z"},"links":{"cited_paper":"/paper/2503.07572","citing_paper":"/paper/2506.10446"},"observation_digest":"sha256:029cd93e2609d49663cc2a616b9882c07e3e6f2140ec067d6fdbd8411e7e1d58","observation_id":"90e46486-f059-4c37-a975-434082a63560","resolution":{"observed_at":"2026-08-07T04:38:09.500490Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.07572","last_updated":"2025-03-10T17:40:43Z","snapshot_observed_at":"2026-08-07T17:16:00.148793Z","submitted_at":"2025-03-10T17:40:43Z","title":"Optimizing Test-Time Compute via Meta Reinforcement Fine-Tuning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.07572","snapshot_observed_at":"2026-08-06T23:57:49.571611Z","title":"Optimizing test-time compute via meta reinforcement fine- tuning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.15647","last_updated":"2025-06-18T17:18:12Z","snapshot_observed_at":"2026-08-06T23:49:37.564860Z","submitted_at":"2025-06-18T17:18:12Z","title":"Exploring and Exploiting the Inherent Efficiency within Large Reasoning Models for Self-Guided Efficiency Enhancement","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T23:57:49.571611Z"},"links":{"cited_paper":"/paper/2503.07572","citing_paper":"/paper/2506.15647"},"observation_digest":"sha256:6cf99c62641c425a920f6b7417f93224b0df59864a795f3ea797d0fa647dda9c","observation_id":"278f6c69-2b5f-40b4-9fda-74409491e923","resolution":{"observed_at":"2026-08-06T23:57:49.571611Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.07572","last_updated":"2025-03-10T17:40:43Z","snapshot_observed_at":"2026-08-07T17:16:00.148793Z","submitted_at":"2025-03-10T17:40:43Z","title":"Optimizing Test-Time Compute via Meta Reinforcement Fine-Tuning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.07572","snapshot_observed_at":"2026-08-06T21:45:09.631754Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.23840","last_updated":"2025-06-30T13:30:33Z","snapshot_observed_at":"2026-08-08T01:50:45.730700Z","submitted_at":"2025-06-30T13:30:33Z","title":"Do Thinking Tokens Help or Trap? Towards More Efficient Large Reasoning Model","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-06T21:45:09.631754Z"},"links":{"cited_paper":"/paper/2503.07572","citing_paper":"/paper/2506.23840"},"observation_digest":"sha256:f63ce7c55cf6d6381f6dcb8d64d990dc9e02a0b3fa41e47feaf4844bd04e4c2e","observation_id":"41da26e3-4e5d-4fb3-8c07-362fc3b80f4f","resolution":{"observed_at":"2026-08-06T21:45:09.631754Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.07572","last_updated":"2025-03-10T17:40:43Z","snapshot_observed_at":"2026-08-07T17:16:00.148793Z","submitted_at":"2025-03-10T17:40:43Z","title":"Optimizing Test-Time Compute via Meta Reinforcement Fine-Tuning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.07572","snapshot_observed_at":"2026-08-06T20:43:10.775809Z","title":"Optimizing test-time compute via meta reinforcement fine-tuning.arXiv preprint arXiv:2503.07572, 2025b","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.02076","last_updated":"2025-07-02T18:27:42Z","snapshot_observed_at":"2026-08-08T01:09:25.758170Z","submitted_at":"2025-07-02T18:27:42Z","title":"Reasoning on a Budget: A Survey of Adaptive and Controllable Test-Time Compute in LLMs","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T20:43:10.775809Z"},"links":{"cited_paper":"/paper/2503.07572","citing_paper":"/paper/2507.02076"},"observation_digest":"sha256:7c0a0c48b8fa972fcf23dca0384f6b96e856ccde192440c7aee5a6d9e94b2819","observation_id":"636d64aa-4260-403f-b138-5acc801f305a","resolution":{"observed_at":"2026-08-06T20:43:10.775809Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.07572","last_updated":"2025-03-10T17:40:43Z","snapshot_observed_at":"2026-08-07T17:16:00.148793Z","submitted_at":"2025-03-10T17:40:43Z","title":"Optimizing Test-Time Compute via Meta Reinforcement Fine-Tuning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.07572","snapshot_observed_at":"2026-08-06T18:11:18.617898Z","title":", author Yang, M.Y.R","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.09075","last_updated":"2025-07-11T23:35:54Z","snapshot_observed_at":"2026-08-08T12:25:01.827357Z","submitted_at":"2025-07-11T23:35:54Z","title":"OpenCodeReasoning-II: A Simple Test Time Scaling Approach via Self-Critique","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-06T18:11:18.617898Z"},"links":{"cited_paper":"/paper/2503.07572","citing_paper":"/paper/2507.09075"},"observation_digest":"sha256:019443ac992c2af7a398fad41c65fb5025baf327e850afebda4db3a0e38a027d","observation_id":"616a595b-8c34-490b-a32e-44a2b1fea9e9","resolution":{"observed_at":"2026-08-06T18:11:18.617898Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.07572","last_updated":"2025-03-10T17:40:43Z","snapshot_observed_at":"2026-08-07T17:16:00.148793Z","submitted_at":"2025-03-10T17:40:43Z","title":"Optimizing Test-Time Compute via Meta Reinforcement Fine-Tuning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.07572","snapshot_observed_at":"2026-08-06T05:14:37.201287Z","title":"Y.; Setlur, A.; Tunstall, L.; Beeching, E","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.02178","last_updated":"2026-06-29T02:19:28Z","snapshot_observed_at":"2026-08-07T20:42:16.632978Z","submitted_at":"2025-08-04T08:22:14Z","title":"Reconsidering Overthinking: Penalizing Internal and External Redundancy in CoT Reasoning","version":3},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-06T05:14:37.201287Z"},"links":{"cited_paper":"/paper/2503.07572","citing_paper":"/paper/2508.02178"},"observation_digest":"sha256:6448defb77efe0ff6e82c3568b8e620fa61be6f62f68f88cf138bedc22cdde00","observation_id":"6491f5ab-6699-46ce-a21b-57d51d5e1cac","resolution":{"observed_at":"2026-08-06T05:14:37.201287Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.07572","last_updated":"2025-03-10T17:40:43Z","snapshot_observed_at":"2026-08-07T17:16:00.148793Z","submitted_at":"2025-03-10T17:40:43Z","title":"Optimizing Test-Time Compute via Meta Reinforcement Fine-Tuning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.07572","snapshot_observed_at":"2026-08-05T17:04:38.734731Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.17196","last_updated":"2025-08-29T14:42:16Z","snapshot_observed_at":"2026-08-06T13:40:01.864747Z","submitted_at":"2025-08-24T03:17:50Z","title":"BudgetThinker: Empowering Budget-aware LLM Reasoning with Control Tokens","version":2},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-05T17:04:38.734731Z"},"links":{"cited_paper":"/paper/2503.07572","citing_paper":"/paper/2508.17196"},"observation_digest":"sha256:90276a8a5264a8e122166a9c437762d098ba7479f790a266d5fadda0719b6695","observation_id":"65b7ebd3-8f31-4636-ab99-73c31d9664ff","resolution":{"observed_at":"2026-08-05T17:04:38.734731Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.07572","last_updated":"2025-03-10T17:40:43Z","snapshot_observed_at":"2026-08-07T17:16:00.148793Z","submitted_at":"2025-03-10T17:40:43Z","title":"Optimizing Test-Time Compute via Meta Reinforcement Fine-Tuning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.07572","snapshot_observed_at":"2026-08-05T16:19:53.905315Z","title":"Optimizing test-time compute via meta reinforcement fine-tuning.arXiv preprint arXiv:2503.07572, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.18773","last_updated":"2025-08-26T07:57:28Z","snapshot_observed_at":"2026-08-08T00:41:33.854460Z","submitted_at":"2025-08-26T07:57:28Z","title":"ThinkDial: An Open Recipe for Controlling Reasoning Effort in Large Language Models","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-05T16:19:53.905315Z"},"links":{"cited_paper":"/paper/2503.07572","citing_paper":"/paper/2508.18773"},"observation_digest":"sha256:abdf00f31c2a92c5ce9706533f0c27ec5452cc69bffbb48ce6ff7adb3d46f80b","observation_id":"0887f2a1-f622-4a95-928f-fac43d84f501","resolution":{"observed_at":"2026-08-05T16:19:53.905315Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.07572","last_updated":"2025-03-10T17:40:43Z","snapshot_observed_at":"2026-08-07T17:16:00.148793Z","submitted_at":"2025-03-10T17:40:43Z","title":"Optimizing Test-Time Compute via Meta Reinforcement Fine-Tuning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.07572","snapshot_observed_at":"2026-08-05T13:52:05.726613Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.04475","last_updated":"2025-08-30T03:09:07Z","snapshot_observed_at":"2026-08-08T21:44:17.416488Z","submitted_at":"2025-08-30T03:09:07Z","title":"ParaThinker: Native Parallel Thinking as a New Paradigm to Scale LLM Test-time Compute","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-05T13:52:05.726613Z"},"links":{"cited_paper":"/paper/2503.07572","citing_paper":"/paper/2509.04475"},"observation_digest":"sha256:60b992598f0e04fc33bdbba593ea450fc6d8605791bf547c51f26e8dccf33817","observation_id":"dd9fa6fe-b7a2-425b-a0b9-596688c4bcad","resolution":{"observed_at":"2026-08-05T13:52:05.726613Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.07572","last_updated":"2025-03-10T17:40:43Z","snapshot_observed_at":"2026-08-07T17:16:00.148793Z","submitted_at":"2025-03-10T17:40:43Z","title":"Optimizing Test-Time Compute via Meta Reinforcement Fine-Tuning","version":1},"cited_work":{"arxiv_id":"2503.07572","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.07572","snapshot_observed_at":"2026-07-04T09:59:44.665948Z","title":"Y ., Setlur, A., Tunstall, L., Beeching, E","venue":null,"work_id":"752e721a-05b7-48c9-9395-60c1f280bd2f","year":2025},"citing_paper":{"arxiv_id":"2509.13332","last_updated":"2026-05-10T19:19:49Z","snapshot_observed_at":"2026-08-03T01:07:13.899742Z","submitted_at":"2025-09-09T18:36:02Z","title":"Explicit Reasoning Makes Better Judges: A Systematic Study on Accuracy, Efficiency, and Robustness","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-18T17:31:28.644151Z"},"links":{"cited_paper":"/paper/2503.07572","citing_paper":"/paper/2509.13332"},"observation_digest":"sha256:c1ac223394559ca5e4badded9d32d57371b9a2b914c2a8827a9a901815c1a989","observation_id":"4636812f-dd2f-435f-be1d-691f9d98dc4b","resolution":{"observed_at":"2026-05-18T17:31:41.560251Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.07572","last_updated":"2025-03-10T17:40:43Z","snapshot_observed_at":"2026-08-07T17:16:00.148793Z","submitted_at":"2025-03-10T17:40:43Z","title":"Optimizing Test-Time Compute via Meta Reinforcement Fine-Tuning","version":1},"cited_work":{"arxiv_id":"2503.07572","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.07572","snapshot_observed_at":"2026-07-04T09:59:44.665948Z","title":"Y ., Setlur, A., Tunstall, L., Beeching, E","venue":null,"work_id":"752e721a-05b7-48c9-9395-60c1f280bd2f","year":2025},"citing_paper":{"arxiv_id":"2602.06475","last_updated":"2026-05-13T09:12:10Z","snapshot_observed_at":"2026-07-06T22:44:46.690576Z","submitted_at":"2026-02-06T08:03:11Z","title":"Towards Generalizable Reasoning: Group Causal Counterfactual Policy Optimization for LLM Reasoning","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-16T07:21:01.335414Z"},"links":{"cited_paper":"/paper/2503.07572","citing_paper":"/paper/2602.06475"},"observation_digest":"sha256:86750f1ef5fb2c8d13870a8207cf270d6ebe7658383839f1648b74170eb72092","observation_id":"3c72c55e-5d48-4e43-bf7b-f95054e9e5bc","resolution":{"observed_at":"2026-05-16T07:22:31.164859Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.07572","last_updated":"2025-03-10T17:40:43Z","snapshot_observed_at":"2026-08-07T17:16:00.148793Z","submitted_at":"2025-03-10T17:40:43Z","title":"Optimizing Test-Time Compute via Meta Reinforcement Fine-Tuning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.07572","snapshot_observed_at":"2026-07-13T14:28:35.916911Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2604.01301","last_updated":"2026-06-09T22:21:28Z","snapshot_observed_at":"2026-07-13T14:28:32.940454Z","submitted_at":"2026-04-01T18:05:32Z","title":"Numerically Optimizing Shortcuts to Adiabaticity: A Hybrid Control Strategy","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-07-13T14:28:35.916911Z"},"links":{"cited_paper":"/paper/2503.07572","citing_paper":"/paper/2604.01301"},"observation_digest":"sha256:53f4bfe14dbe56c3da55e6c0c3be355969fffe813936bfe75c67fd730b6e56fc","observation_id":"0c1130d8-29e0-4132-a5fb-cceb8f533b3a","resolution":{"observed_at":"2026-07-13T14:28:35.916911Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.07572","last_updated":"2025-03-10T17:40:43Z","snapshot_observed_at":"2026-08-07T17:16:00.148793Z","submitted_at":"2025-03-10T17:40:43Z","title":"Optimizing Test-Time Compute via Meta Reinforcement Fine-Tuning","version":1},"cited_work":{"arxiv_id":"2503.07572","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.07572","snapshot_observed_at":"2026-07-04T09:59:44.665948Z","title":"Y ., Setlur, A., Tunstall, L., Beeching, E","venue":null,"work_id":"752e721a-05b7-48c9-9395-60c1f280bd2f","year":2025},"citing_paper":{"arxiv_id":"2604.07851","last_updated":"2026-04-09T06:07:03Z","snapshot_observed_at":"2026-08-03T12:28:38.894496Z","submitted_at":"2026-04-09T06:07:03Z","title":"ReRec: Reasoning-Augmented LLM-based Recommendation Assistant via Reinforcement Fine-tuning","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-05-10T17:29:34.145855Z"},"links":{"cited_paper":"/paper/2503.07572","citing_paper":"/paper/2604.07851"},"observation_digest":"sha256:8be6f80d14702bf80ca17638aac183654f85a98efe0d07059165bf11f7ac88d6","observation_id":"6698c8d1-37ab-4ce2-80f0-bd785d300b04","resolution":{"observed_at":"2026-05-11T06:41:42.649683Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.07572","last_updated":"2025-03-10T17:40:43Z","snapshot_observed_at":"2026-08-07T17:16:00.148793Z","submitted_at":"2025-03-10T17:40:43Z","title":"Optimizing Test-Time Compute via Meta Reinforcement Fine-Tuning","version":1},"cited_work":{"arxiv_id":"2503.07572","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.07572","snapshot_observed_at":"2026-07-04T09:59:44.665948Z","title":"Y ., Setlur, A., Tunstall, L., Beeching, E","venue":null,"work_id":"752e721a-05b7-48c9-9395-60c1f280bd2f","year":2025},"citing_paper":{"arxiv_id":"2604.15830","last_updated":"2026-05-01T11:47:10Z","snapshot_observed_at":"2026-07-06T23:03:16.345488Z","submitted_at":"2026-04-17T08:34:51Z","title":"Placing Puzzle Pieces Where They Matter: A Question Augmentation Framework for Reinforcement Learning","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-10T08:30:40.368494Z"},"links":{"cited_paper":"/paper/2503.07572","citing_paper":"/paper/2604.15830"},"observation_digest":"sha256:71c81bbe9dc1a602e6203a0e539f82d2717e667a973d626631c08282d44e4c3b","observation_id":"3ff69dcd-fcf7-4372-bb43-db31ef2cab14","resolution":{"observed_at":"2026-05-10T08:58:13.702378Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.07572","last_updated":"2025-03-10T17:40:43Z","snapshot_observed_at":"2026-08-07T17:16:00.148793Z","submitted_at":"2025-03-10T17:40:43Z","title":"Optimizing Test-Time Compute via Meta Reinforcement Fine-Tuning","version":1},"cited_work":{"arxiv_id":"2503.07572","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.07572","snapshot_observed_at":"2026-07-04T09:59:44.665948Z","title":"Y ., Setlur, A., Tunstall, L., Beeching, E","venue":null,"work_id":"752e721a-05b7-48c9-9395-60c1f280bd2f","year":2025},"citing_paper":{"arxiv_id":"2604.18839","last_updated":"2026-04-20T21:06:12Z","snapshot_observed_at":"2026-07-06T23:05:35.374092Z","submitted_at":"2026-04-20T21:06:12Z","title":"One Step Forward and K Steps Back: Better Reasoning with Denoising Recursion Models","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-05-10T04:56:35.796962Z"},"links":{"cited_paper":"/paper/2503.07572","citing_paper":"/paper/2604.18839"},"observation_digest":"sha256:4dfe4e582bb0456762f9a5bc35b72382bae14c5a4110827e0c02fc6817107787","observation_id":"c1d05090-8e18-4e84-a6a4-0e01974bebef","resolution":{"observed_at":"2026-05-10T11:05:09.170236Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.07572","last_updated":"2025-03-10T17:40:43Z","snapshot_observed_at":"2026-08-07T17:16:00.148793Z","submitted_at":"2025-03-10T17:40:43Z","title":"Optimizing Test-Time Compute via Meta Reinforcement Fine-Tuning","version":1},"cited_work":{"arxiv_id":"2503.07572","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.07572","snapshot_observed_at":"2026-07-04T09:59:44.665948Z","title":"Y ., Setlur, A., Tunstall, L., Beeching, E","venue":null,"work_id":"752e721a-05b7-48c9-9395-60c1f280bd2f","year":2025},"citing_paper":{"arxiv_id":"2604.20659","last_updated":"2026-04-22T15:08:58Z","snapshot_observed_at":"2026-08-08T18:41:30.145626Z","submitted_at":"2026-04-22T15:08:58Z","title":"GRPO-VPS: Enhancing Group Relative Policy Optimization with Verifiable Process Supervision for Effective Reasoning","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-10T00:14:29.531510Z"},"links":{"cited_paper":"/paper/2503.07572","citing_paper":"/paper/2604.20659"},"observation_digest":"sha256:c753d448bfd1785f1c179c00a3e4984eaecbc91565c752f73ea3f4ae40b62a13","observation_id":"445599e8-7336-47a9-84c1-fc24e4dd4631","resolution":{"observed_at":"2026-05-10T00:14:46.333051Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.07572","last_updated":"2025-03-10T17:40:43Z","snapshot_observed_at":"2026-08-07T17:16:00.148793Z","submitted_at":"2025-03-10T17:40:43Z","title":"Optimizing Test-Time Compute via Meta Reinforcement Fine-Tuning","version":1},"cited_work":{"arxiv_id":"2503.07572","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.07572","snapshot_observed_at":"2026-07-04T09:59:44.665948Z","title":"Y ., Setlur, A., Tunstall, L., Beeching, E","venue":null,"work_id":"752e721a-05b7-48c9-9395-60c1f280bd2f","year":2025},"citing_paper":{"arxiv_id":"2605.02290","last_updated":"2026-05-04T07:26:41Z","snapshot_observed_at":"2026-08-02T10:20:40.458806Z","submitted_at":"2026-05-04T07:26:41Z","title":"Distilling Long-CoT Reasoning through Collaborative Step-wise Multi-Teacher Decoding","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-05-09T16:29:05.186607Z"},"links":{"cited_paper":"/paper/2503.07572","citing_paper":"/paper/2605.02290"},"observation_digest":"sha256:615e9a66279efdf1b0d766157860da28c45c9e7212c5d1f82a9dfecf14d44f1c","observation_id":"86f5545e-8def-4fb0-badb-00ca4cf91a46","resolution":{"observed_at":"2026-05-11T16:31:08.850034Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.07572","last_updated":"2025-03-10T17:40:43Z","snapshot_observed_at":"2026-08-07T17:16:00.148793Z","submitted_at":"2025-03-10T17:40:43Z","title":"Optimizing Test-Time Compute via Meta Reinforcement Fine-Tuning","version":1},"cited_work":{"arxiv_id":"2503.07572","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.07572","snapshot_observed_at":"2026-07-04T09:59:44.665948Z","title":"Y ., Setlur, A., Tunstall, L., Beeching, E","venue":null,"work_id":"752e721a-05b7-48c9-9395-60c1f280bd2f","year":2025},"citing_paper":{"arxiv_id":"2605.06165","last_updated":"2026-05-07T12:51:49Z","snapshot_observed_at":"2026-07-06T23:18:41.400741Z","submitted_at":"2026-05-07T12:51:49Z","title":"Post Reasoning: Improving the Performance of Non-Thinking Models at No Cost","version":1},"reference_index":157,"source":"arxiv_source","source_observed_at":"2026-05-08T10:19:08.451445Z"},"links":{"cited_paper":"/paper/2503.07572","citing_paper":"/paper/2605.06165"},"observation_digest":"sha256:fd9c5eccca1f4c57db6a1ffe9c423d84185d05b93870c614345189c3af1859e4","observation_id":"059e7f97-c690-44a9-9d51-8eb20603a599","resolution":{"observed_at":"2026-05-11T20:06:09.204015Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.07572","last_updated":"2025-03-10T17:40:43Z","snapshot_observed_at":"2026-08-07T17:16:00.148793Z","submitted_at":"2025-03-10T17:40:43Z","title":"Optimizing Test-Time Compute via Meta Reinforcement Fine-Tuning","version":1},"cited_work":{"arxiv_id":"2503.07572","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.07572","snapshot_observed_at":"2026-07-04T09:59:44.665948Z","title":"Y ., Setlur, A., Tunstall, L., Beeching, E","venue":null,"work_id":"752e721a-05b7-48c9-9395-60c1f280bd2f","year":2025},"citing_paper":{"arxiv_id":"2605.08665","last_updated":"2026-06-03T08:11:51Z","snapshot_observed_at":"2026-07-06T23:20:52.521341Z","submitted_at":"2026-05-09T04:07:16Z","title":"Hint Tuning: Less Data Makes Better Reasoners","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-12T00:54:13.146373Z"},"links":{"cited_paper":"/paper/2503.07572","citing_paper":"/paper/2605.08665"},"observation_digest":"sha256:33b221042a2781a3609fb0bb5e226a8c55df62717c8dc212226cab0c99d2be4c","observation_id":"63dd714d-a3d3-4cd1-967a-58432dc6f5b5","resolution":{"observed_at":"2026-05-12T08:36:26.324301Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.07572","last_updated":"2025-03-10T17:40:43Z","snapshot_observed_at":"2026-08-07T17:16:00.148793Z","submitted_at":"2025-03-10T17:40:43Z","title":"Optimizing Test-Time Compute via Meta Reinforcement Fine-Tuning","version":1},"cited_work":{"arxiv_id":"2503.07572","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.07572","snapshot_observed_at":"2026-07-04T09:59:44.665948Z","title":"Y ., Setlur, A., Tunstall, L., Beeching, E","venue":null,"work_id":"752e721a-05b7-48c9-9395-60c1f280bd2f","year":2025},"citing_paper":{"arxiv_id":"2605.08665","last_updated":"2026-06-03T08:11:51Z","snapshot_observed_at":"2026-07-06T23:20:52.521341Z","submitted_at":"2026-05-09T04:07:16Z","title":"Hint Tuning: Less Data Makes Better Reasoners","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-06-30T23:34:43.785312Z"},"links":{"cited_paper":"/paper/2503.07572","citing_paper":"/paper/2605.08665"},"observation_digest":"sha256:d88d4e899b4ef464d57677ed756ff20d8925402b7dcdb01acacce7fe70c7ca36","observation_id":"e4808b51-4c5a-4ca8-9a52-22458dfbca55","resolution":{"observed_at":"2026-06-30T23:35:07.076988Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.07572","last_updated":"2025-03-10T17:40:43Z","snapshot_observed_at":"2026-08-07T17:16:00.148793Z","submitted_at":"2025-03-10T17:40:43Z","title":"Optimizing Test-Time Compute via Meta Reinforcement Fine-Tuning","version":1},"cited_work":{"arxiv_id":"2503.07572","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.07572","snapshot_observed_at":"2026-07-04T09:59:44.665948Z","title":"Y ., Setlur, A., Tunstall, L., Beeching, E","venue":null,"work_id":"752e721a-05b7-48c9-9395-60c1f280bd2f","year":2025},"citing_paper":{"arxiv_id":"2605.24396","last_updated":"2026-05-23T04:42:45Z","snapshot_observed_at":"2026-08-08T23:48:46.091037Z","submitted_at":"2026-05-23T04:42:45Z","title":"Understanding and Mitigating Premature Confidence for Better LLM Reasoning","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-06-30T14:03:25.913615Z"},"links":{"cited_paper":"/paper/2503.07572","citing_paper":"/paper/2605.24396"},"observation_digest":"sha256:f21c7ec702de2be48c89ab5954b3248ecb75dd44071c8d390b469fe9c07dec4f","observation_id":"3c12158d-10a5-4b28-bf02-1bdde217889a","resolution":{"observed_at":"2026-06-30T14:04:44.414204Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.07572","last_updated":"2025-03-10T17:40:43Z","snapshot_observed_at":"2026-08-07T17:16:00.148793Z","submitted_at":"2025-03-10T17:40:43Z","title":"Optimizing Test-Time Compute via Meta Reinforcement Fine-Tuning","version":1},"cited_work":{"arxiv_id":"2503.07572","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.07572","snapshot_observed_at":"2026-07-04T09:59:44.665948Z","title":"Y ., Setlur, A., Tunstall, L., Beeching, E","venue":null,"work_id":"752e721a-05b7-48c9-9395-60c1f280bd2f","year":2025},"citing_paper":{"arxiv_id":"2606.21943","last_updated":"2026-06-20T08:20:41Z","snapshot_observed_at":"2026-07-06T23:56:54.959593Z","submitted_at":"2026-06-20T08:20:41Z","title":"Modularized Reinforcement Learning on LLMs: From MDP Creation to Exploration and Learning","version":1},"reference_index":157,"source":"pdf_text","source_observed_at":"2026-06-26T12:15:08.304150Z"},"links":{"cited_paper":"/paper/2503.07572","citing_paper":"/paper/2606.21943"},"observation_digest":"sha256:50a19b9fa66aa8895e4f8ea41f363e4b6b1123b6ffd8da1cbeb779a739d4fb4c","observation_id":"17a0c6e7-55d2-4b2e-81e2-e9977bb01337","resolution":{"observed_at":"2026-07-04T07:59:40.725804Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.07572","last_updated":"2025-03-10T17:40:43Z","snapshot_observed_at":"2026-08-07T17:16:00.148793Z","submitted_at":"2025-03-10T17:40:43Z","title":"Optimizing Test-Time Compute via Meta Reinforcement Fine-Tuning","version":1},"cited_work":{"arxiv_id":"2503.07572","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.07572","snapshot_observed_at":"2026-07-04T09:59:44.665948Z","title":"Y ., Setlur, A., Tunstall, L., Beeching, E","venue":null,"work_id":"752e721a-05b7-48c9-9395-60c1f280bd2f","year":2025},"citing_paper":{"arxiv_id":"2606.23640","last_updated":"2026-06-22T17:30:24Z","snapshot_observed_at":"2026-08-02T09:22:48.099895Z","submitted_at":"2026-06-22T17:30:24Z","title":"Learning Process Rewards via Success Visitation Matching for Efficient RL","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-06-26T09:20:35.062060Z"},"links":{"cited_paper":"/paper/2503.07572","citing_paper":"/paper/2606.23640"},"observation_digest":"sha256:d2ae1b84f7b992610b623344a47f7484fa4b348fca7de93a87be972cb31bb3a5","observation_id":"0d103120-ebce-4d84-9874-fd1eb5670917","resolution":{"observed_at":"2026-07-04T09:59:44.667858Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.07572","last_updated":"2025-03-10T17:40:43Z","snapshot_observed_at":"2026-08-07T17:16:00.148793Z","submitted_at":"2025-03-10T17:40:43Z","title":"Optimizing Test-Time Compute via Meta Reinforcement Fine-Tuning","version":1},"cited_work":{"arxiv_id":"2503.07572","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.07572","snapshot_observed_at":"2026-07-04T09:59:44.665948Z","title":"Y ., Setlur, A., Tunstall, L., Beeching, E","venue":null,"work_id":"752e721a-05b7-48c9-9395-60c1f280bd2f","year":2025},"citing_paper":{"arxiv_id":"2606.31748","last_updated":"2026-06-30T14:38:49Z","snapshot_observed_at":"2026-07-07T00:05:27.130060Z","submitted_at":"2026-06-30T14:38:49Z","title":"Addressing Over-Refusal in LLMs with Competing Rewards","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-07-01T06:59:12.695984Z"},"links":{"cited_paper":"/paper/2503.07572","citing_paper":"/paper/2606.31748"},"observation_digest":"sha256:23818da19c0f973b525e500c01d9af61323e6f83a3725cbcd41d0b42b0a5e931","observation_id":"3b0fc51b-ff58-405e-ad0f-42a374f2bc6b","resolution":{"observed_at":"2026-07-01T07:05:29.165526Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.07572","last_updated":"2025-03-10T17:40:43Z","snapshot_observed_at":"2026-08-07T17:16:00.148793Z","submitted_at":"2025-03-10T17:40:43Z","title":"Optimizing Test-Time Compute via Meta Reinforcement Fine-Tuning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.07572","snapshot_observed_at":"2026-07-14T12:08:05.502310Z","title":"arXiv preprint arXiv:2503.07572 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10386","last_updated":"2026-07-11T16:29:51Z","snapshot_observed_at":"2026-08-03T03:24:52.663992Z","submitted_at":"2026-07-11T16:29:51Z","title":"Structured Thoughts For Improved Reasoning And Context Pruning","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-07-14T12:08:05.502310Z"},"links":{"cited_paper":"/paper/2503.07572","citing_paper":"/paper/2607.10386"},"observation_digest":"sha256:51727d272ef408d78ce3a88252de8307f6986df37fdb5c980d394fe5ea177c9f","observation_id":"da886d2f-5d1b-45f5-b92c-c7ec909f6a29","resolution":{"observed_at":"2026-07-14T12:08:05.502310Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2503.07572/citation-record","integrity":"/paper/2503.07572/integrity","json":"/paper/2503.07572/citation-record.json","paper":"/paper/2503.07572"},"outbound":[],"paper":{"arxiv_id":"2503.07572","last_updated":"2025-03-10T17:40:43Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-07T17:16:00.148793Z","submitted_at":"2025-03-10T17:40:43Z","title":"Optimizing Test-Time Compute via Meta Reinforcement Fine-Tuning"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 41 inbound Pith citation observations for arXiv:2503.07572."}