{"as_of":"2026-08-09T22:48:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:558c6ea6fe025433548a6a9f3d6eef73f5d8700206c0a643c264504376d99b6b","coverage":[{"denominator":40,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":40,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T11:21:28.356097Z","state":"measured"},{"denominator":57,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":57,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":17,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":17,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T04:30:45.506154Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"arxiv_reference","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":0,"observed_at":"2026-08-05T02:28:24.338817Z","source":"arxiv_reference"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2507.22844","last_updated":"2025-07-30T17:00:48Z","snapshot_observed_at":"2026-08-07T22:42:41.639384Z","submitted_at":"2025-07-30T17:00:48Z","title":"RLVMR: Reinforcement Learning with Verifiable Meta-Reasoning Rewards for Robust Long-Horizon Agents","version":1},"cited_work":{"arxiv_id":"2507.22844","doi":"10.48550/arxiv.2507.22844","metadata_source":"arxiv_reference","pith_arxiv_id":"2507.22844","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"RLVMR: Reinforce- ment Learning with Verifiable Meta-Reasoning Rewards for Robust Long-Horizon Agents","venue":"arXiv (Cornell University)","work_id":"e1c07e12-4ba6-4121-83b1-0e11a23f6a46","year":2025},"citing_paper":{"arxiv_id":"2509.02547","last_updated":"2026-04-17T18:09:08Z","snapshot_observed_at":"2026-08-03T09:07:42.489237Z","submitted_at":"2025-09-02T17:46:26Z","title":"The Landscape of Agentic Reinforcement Learning for LLMs: A Survey","version":5},"reference_index":269,"source":"pdf_text","source_observed_at":"2026-05-18T19:19:36.427337Z"},"links":{"cited_paper":"/paper/2507.22844","citing_paper":"/paper/2509.02547"},"observation_digest":"sha256:6a18692f74522de43c9dca222e488894febc463751f775773bdf0cc843b02636","observation_id":"6287142b-4835-4649-bbb1-98811edc27ab","resolution":{"observed_at":"2026-05-18T19:21:48.666577Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-05-22T15:52:33.637506+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-22T15:52:33.637506+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.22844","last_updated":"2025-07-30T17:00:48Z","snapshot_observed_at":"2026-08-07T22:42:41.639384Z","submitted_at":"2025-07-30T17:00:48Z","title":"RLVMR: Reinforcement Learning with Verifiable Meta-Reasoning Rewards for Robust Long-Horizon Agents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.22844","snapshot_observed_at":"2026-08-04T09:33:42.644462Z","title":"num_train_epochs","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.14828","last_updated":"2026-06-09T15:51:56Z","snapshot_observed_at":"2026-08-08T23:57:30.634515Z","submitted_at":"2025-10-16T16:04:35Z","title":"RoboGPT-R1: Enhancing Robot Task Planning with Reinforcement Learning","version":3},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-04T09:33:42.644462Z"},"links":{"cited_paper":"/paper/2507.22844","citing_paper":"/paper/2510.14828"},"observation_digest":"sha256:dbcf275f71fe7a3b9f39b140a3fb74da00b6a31bd4c08824cafee428466efb8d","observation_id":"f88f39fd-5a20-47bc-aadf-f41e12188cba","resolution":{"observed_at":"2026-08-04T09:33:42.644462Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.22844","last_updated":"2025-07-30T17:00:48Z","snapshot_observed_at":"2026-08-07T22:42:41.639384Z","submitted_at":"2025-07-30T17:00:48Z","title":"RLVMR: Reinforcement Learning with Verifiable Meta-Reasoning Rewards for Robust Long-Horizon Agents","version":1},"cited_work":{"arxiv_id":"2507.22844","doi":"10.48550/arxiv.2507.22844","metadata_source":"arxiv_reference","pith_arxiv_id":"2507.22844","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"RLVMR: Reinforce- ment Learning with Verifiable Meta-Reasoning Rewards for Robust Long-Horizon Agents","venue":"arXiv (Cornell University)","work_id":"e1c07e12-4ba6-4121-83b1-0e11a23f6a46","year":2025},"citing_paper":{"arxiv_id":"2512.13399","last_updated":"2026-05-13T04:43:51Z","snapshot_observed_at":"2026-08-02T20:35:00.137172Z","submitted_at":"2025-12-15T14:50:08Z","title":"Differentiable Evolutionary Reinforcement Learning","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-16T22:34:47.984401Z"},"links":{"cited_paper":"/paper/2507.22844","citing_paper":"/paper/2512.13399"},"observation_digest":"sha256:d6aa45dc4ca971f1c02737bd7621ecd081d9384a5d31d07f548072416d82ba05","observation_id":"78e53603-8078-4053-9f3f-5712016ef43b","resolution":{"observed_at":"2026-05-16T22:38:37.689797Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-05-22T15:52:33.637506+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-22T15:52:33.637506+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.22844","last_updated":"2025-07-30T17:00:48Z","snapshot_observed_at":"2026-08-07T22:42:41.639384Z","submitted_at":"2025-07-30T17:00:48Z","title":"RLVMR: Reinforcement Learning with Verifiable Meta-Reasoning Rewards for Robust Long-Horizon Agents","version":1},"cited_work":{"arxiv_id":"2507.22844","doi":"10.48550/arxiv.2507.22844","metadata_source":"arxiv_reference","pith_arxiv_id":"2507.22844","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"RLVMR: Reinforce- ment Learning with Verifiable Meta-Reasoning Rewards for Robust Long-Horizon Agents","venue":"arXiv (Cornell University)","work_id":"e1c07e12-4ba6-4121-83b1-0e11a23f6a46","year":2025},"citing_paper":{"arxiv_id":"2601.12538","last_updated":"2026-01-18T18:58:23Z","snapshot_observed_at":"2026-08-04T22:42:23.171653Z","submitted_at":"2026-01-18T18:58:23Z","title":"Agentic Reasoning for Large Language Models","version":1},"reference_index":237,"source":"pdf_text","source_observed_at":"2026-05-17T15:14:25.558878Z"},"links":{"cited_paper":"/paper/2507.22844","citing_paper":"/paper/2601.12538"},"observation_digest":"sha256:4179002e32953e68237abadde1ca33bfa69b2a9fbab81a3248f4a945a6feeefb","observation_id":"cc3355c7-9b12-4dc7-a994-69ceeb212dce","resolution":{"observed_at":"2026-05-17T15:14:26.310487Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-05-22T15:52:33.637506+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-22T15:52:33.637506+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.22844","last_updated":"2025-07-30T17:00:48Z","snapshot_observed_at":"2026-08-07T22:42:41.639384Z","submitted_at":"2025-07-30T17:00:48Z","title":"RLVMR: Reinforcement Learning with Verifiable Meta-Reasoning Rewards for Robust Long-Horizon Agents","version":1},"cited_work":{"arxiv_id":"2507.22844","doi":"10.48550/arxiv.2507.22844","metadata_source":"arxiv_reference","pith_arxiv_id":"2507.22844","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"RLVMR: Reinforce- ment Learning with Verifiable Meta-Reasoning Rewards for Robust Long-Horizon Agents","venue":"arXiv (Cornell University)","work_id":"e1c07e12-4ba6-4121-83b1-0e11a23f6a46","year":2025},"citing_paper":{"arxiv_id":"2604.07774","last_updated":"2026-04-09T04:01:27Z","snapshot_observed_at":"2026-07-06T22:57:00.904627Z","submitted_at":"2026-04-09T04:01:27Z","title":"RoboAgent: Chaining Basic Capabilities for Embodied Task Planning","version":1},"reference_index":138,"source":"pdf_text","source_observed_at":"2026-05-10T18:15:08.727921Z"},"links":{"cited_paper":"/paper/2507.22844","citing_paper":"/paper/2604.07774"},"observation_digest":"sha256:9295b11d90c977cbd527dc24a798d76c02e558113ed4944f8558278677543a33","observation_id":"d56dd12c-0b56-454d-9b81-0981a35525cc","resolution":{"observed_at":"2026-05-11T05:15:57.001034Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-05-22T15:52:33.637506+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-22T15:52:33.637506+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.22844","last_updated":"2025-07-30T17:00:48Z","snapshot_observed_at":"2026-08-07T22:42:41.639384Z","submitted_at":"2025-07-30T17:00:48Z","title":"RLVMR: Reinforcement Learning with Verifiable Meta-Reasoning Rewards for Robust Long-Horizon Agents","version":1},"cited_work":{"arxiv_id":"2507.22844","doi":"10.48550/arxiv.2507.22844","metadata_source":"arxiv_reference","pith_arxiv_id":"2507.22844","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"RLVMR: Reinforce- ment Learning with Verifiable Meta-Reasoning Rewards for Robust Long-Horizon Agents","venue":"arXiv (Cornell University)","work_id":"e1c07e12-4ba6-4121-83b1-0e11a23f6a46","year":2025},"citing_paper":{"arxiv_id":"2604.17399","last_updated":"2026-04-19T12:02:30Z","snapshot_observed_at":"2026-08-07T14:21:17.351574Z","submitted_at":"2026-04-19T12:02:30Z","title":"Beyond Meta-Reasoning: Metacognitive Consolidation for Self-Improving LLM Reasoning","version":1},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-05-10T06:14:19.580071Z"},"links":{"cited_paper":"/paper/2507.22844","citing_paper":"/paper/2604.17399"},"observation_digest":"sha256:e213ef5178c42bb2661ab60f0cf2afebdc03e023b1e37509d78da290cc413d64","observation_id":"f6a405de-44c1-43f2-951e-dde3dce430d5","resolution":{"observed_at":"2026-05-10T06:21:27.129260Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-05-22T15:52:33.637506+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-22T15:52:33.637506+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.22844","last_updated":"2025-07-30T17:00:48Z","snapshot_observed_at":"2026-08-07T22:42:41.639384Z","submitted_at":"2025-07-30T17:00:48Z","title":"RLVMR: Reinforcement Learning with Verifiable Meta-Reasoning Rewards for Robust Long-Horizon Agents","version":1},"cited_work":{"arxiv_id":"2507.22844","doi":"10.48550/arxiv.2507.22844","metadata_source":"arxiv_reference","pith_arxiv_id":"2507.22844","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"RLVMR: Reinforce- ment Learning with Verifiable Meta-Reasoning Rewards for Robust Long-Horizon Agents","venue":"arXiv (Cornell University)","work_id":"e1c07e12-4ba6-4121-83b1-0e11a23f6a46","year":2025},"citing_paper":{"arxiv_id":"2604.24320","last_updated":"2026-04-27T11:09:49Z","snapshot_observed_at":"2026-07-06T23:10:24.992210Z","submitted_at":"2026-04-27T11:09:49Z","title":"DPEPO: Diverse Parallel Exploration Policy Optimization for LLM-based Agents","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-08T03:37:30.156901Z"},"links":{"cited_paper":"/paper/2507.22844","citing_paper":"/paper/2604.24320"},"observation_digest":"sha256:d72a7adbfdfc4782f425e5170565281187d76b359e79d95d24785425a3ab7a13","observation_id":"7b8b3264-a6b4-4a55-b1a6-37108d034a8e","resolution":{"observed_at":"2026-05-11T22:01:11.869722Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-05-22T15:52:33.637506+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-22T15:52:33.637506+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.22844","last_updated":"2025-07-30T17:00:48Z","snapshot_observed_at":"2026-08-07T22:42:41.639384Z","submitted_at":"2025-07-30T17:00:48Z","title":"RLVMR: Reinforcement Learning with Verifiable Meta-Reasoning Rewards for Robust Long-Horizon Agents","version":1},"cited_work":{"arxiv_id":"2507.22844","doi":"10.48550/arxiv.2507.22844","metadata_source":"arxiv_reference","pith_arxiv_id":"2507.22844","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"RLVMR: Reinforce- ment Learning with Verifiable Meta-Reasoning Rewards for Robust Long-Horizon Agents","venue":"arXiv (Cornell University)","work_id":"e1c07e12-4ba6-4121-83b1-0e11a23f6a46","year":2025},"citing_paper":{"arxiv_id":"2605.21951","last_updated":"2026-05-21T03:35:10Z","snapshot_observed_at":"2026-07-31T14:36:47.956964Z","submitted_at":"2026-05-21T03:35:10Z","title":"Dynamic Mixture of Latent Memories for Self-Evolving Agents","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-22T07:38:42.113849Z"},"links":{"cited_paper":"/paper/2507.22844","citing_paper":"/paper/2605.21951"},"observation_digest":"sha256:ccb28a5c4a1bf56e2589c6f9982f0e9b27e5775a8e60f5ec9005b9017146c4e0","observation_id":"888a8468-6fc4-4324-bb82-018071e57209","resolution":{"observed_at":"2026-05-22T07:41:14.489608Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-05-22T15:52:33.637506+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-22T15:52:33.637506+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.22844","last_updated":"2025-07-30T17:00:48Z","snapshot_observed_at":"2026-08-07T22:42:41.639384Z","submitted_at":"2025-07-30T17:00:48Z","title":"RLVMR: Reinforcement Learning with Verifiable Meta-Reasoning Rewards for Robust Long-Horizon Agents","version":1},"cited_work":{"arxiv_id":"2507.22844","doi":"10.48550/arxiv.2507.22844","metadata_source":"arxiv_reference","pith_arxiv_id":"2507.22844","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"RLVMR: Reinforce- ment Learning with Verifiable Meta-Reasoning Rewards for Robust Long-Horizon Agents","venue":"arXiv (Cornell University)","work_id":"e1c07e12-4ba6-4121-83b1-0e11a23f6a46","year":2025},"citing_paper":{"arxiv_id":"2605.23989","last_updated":"2026-05-17T10:26:37Z","snapshot_observed_at":"2026-07-06T23:34:08.786038Z","submitted_at":"2026-05-17T10:26:37Z","title":"Towards trustworthy agentic AI: a comprehensive survey of safety, robustness, privacy, and system security","version":1},"reference_index":206,"source":"pdf_text","source_observed_at":"2026-06-30T19:18:40.244556Z"},"links":{"cited_paper":"/paper/2507.22844","citing_paper":"/paper/2605.23989"},"observation_digest":"sha256:cba827c7c4a2a2c09d44d16113b23b47f3182fb98200e5a2b4ea2d19a06f3fad","observation_id":"2e1cd5bb-ed16-4e47-87b1-71e7a414d50f","resolution":{"observed_at":"2026-06-30T19:45:01.653011Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-05-22T15:52:33.637506+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-22T15:52:33.637506+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.22844","last_updated":"2025-07-30T17:00:48Z","snapshot_observed_at":"2026-08-07T22:42:41.639384Z","submitted_at":"2025-07-30T17:00:48Z","title":"RLVMR: Reinforcement Learning with Verifiable Meta-Reasoning Rewards for Robust Long-Horizon Agents","version":1},"cited_work":{"arxiv_id":"2507.22844","doi":"10.48550/arxiv.2507.22844","metadata_source":"arxiv_reference","pith_arxiv_id":"2507.22844","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"RLVMR: Reinforce- ment Learning with Verifiable Meta-Reasoning Rewards for Robust Long-Horizon Agents","venue":"arXiv (Cornell University)","work_id":"e1c07e12-4ba6-4121-83b1-0e11a23f6a46","year":2025},"citing_paper":{"arxiv_id":"2606.18089","last_updated":"2026-07-05T17:40:26Z","snapshot_observed_at":"2026-07-12T13:34:39.011240Z","submitted_at":"2026-06-16T15:55:28Z","title":"From Reasoning Traces to Reusable Modules: Understanding Compositional Generalization in Language Model Reasoning","version":1},"reference_index":102,"source":"arxiv_source","source_observed_at":"2026-06-27T01:13:11.483599Z"},"links":{"cited_paper":"/paper/2507.22844","citing_paper":"/paper/2606.18089"},"observation_digest":"sha256:c4fe43b324c806f33d46fc5259d6fc18edb5c1ec0719f1639ddb9cfd05665bbe","observation_id":"66fbc2e9-14e9-4686-ae43-08548ab38b29","resolution":{"observed_at":"2026-07-03T20:38:55.863082Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-05-22T15:52:33.637506+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-22T15:52:33.637506+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.22844","last_updated":"2025-07-30T17:00:48Z","snapshot_observed_at":"2026-08-07T22:42:41.639384Z","submitted_at":"2025-07-30T17:00:48Z","title":"RLVMR: Reinforcement Learning with Verifiable Meta-Reasoning Rewards for Robust Long-Horizon Agents","version":1},"cited_work":{"arxiv_id":"2507.22844","doi":"10.48550/arxiv.2507.22844","metadata_source":"arxiv_reference","pith_arxiv_id":"2507.22844","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"RLVMR: Reinforce- ment Learning with Verifiable Meta-Reasoning Rewards for Robust Long-Horizon Agents","venue":"arXiv (Cornell University)","work_id":"e1c07e12-4ba6-4121-83b1-0e11a23f6a46","year":2025},"citing_paper":{"arxiv_id":"2606.25852","last_updated":"2026-06-24T14:02:13Z","snapshot_observed_at":"2026-07-07T00:00:17.090702Z","submitted_at":"2026-06-24T14:02:13Z","title":"Semantic Consistency Policy Optimization for Reinforcement Learning of LLM Agents","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-06-25T20:16:39.347676Z"},"links":{"cited_paper":"/paper/2507.22844","citing_paper":"/paper/2606.25852"},"observation_digest":"sha256:6829f9170296720391d6d6e3c16a43e7694cd5fabd4a1504090ffce23b5746b8","observation_id":"158c06d6-9cc9-4393-841d-356cfdfb1d41","resolution":{"observed_at":"2026-07-04T20:20:07.618792Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-05-22T15:52:33.637506+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-22T15:52:33.637506+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.22844","last_updated":"2025-07-30T17:00:48Z","snapshot_observed_at":"2026-08-07T22:42:41.639384Z","submitted_at":"2025-07-30T17:00:48Z","title":"RLVMR: Reinforcement Learning with Verifiable Meta-Reasoning Rewards for Robust Long-Horizon Agents","version":1},"cited_work":{"arxiv_id":"2507.22844","doi":"10.48550/arxiv.2507.22844","metadata_source":"arxiv_reference","pith_arxiv_id":"2507.22844","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"RLVMR: Reinforce- ment Learning with Verifiable Meta-Reasoning Rewards for Robust Long-Horizon Agents","venue":"arXiv (Cornell University)","work_id":"e1c07e12-4ba6-4121-83b1-0e11a23f6a46","year":2025},"citing_paper":{"arxiv_id":"2606.26918","last_updated":"2026-06-25T11:53:41Z","snapshot_observed_at":"2026-08-07T14:15:31.695220Z","submitted_at":"2026-06-25T11:53:41Z","title":"Diagnosing Task Insensitivity in Language Agents","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-06-26T04:58:11.929896Z"},"links":{"cited_paper":"/paper/2507.22844","citing_paper":"/paper/2606.26918"},"observation_digest":"sha256:4eea88ac75771a1c410e54d936a4b68ff5d2646610b1ec5307f9bd6108ab6b00","observation_id":"447b24f9-a4f4-4440-bff1-ce73c7e0bc3b","resolution":{"observed_at":"2026-07-04T13:39:51.548061Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-05-22T15:52:33.637506+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-22T15:52:33.637506+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.22844","last_updated":"2025-07-30T17:00:48Z","snapshot_observed_at":"2026-08-07T22:42:41.639384Z","submitted_at":"2025-07-30T17:00:48Z","title":"RLVMR: Reinforcement Learning with Verifiable Meta-Reasoning Rewards for Robust Long-Horizon Agents","version":1},"cited_work":{"arxiv_id":"2507.22844","doi":"10.48550/arxiv.2507.22844","metadata_source":"arxiv_reference","pith_arxiv_id":"2507.22844","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"RLVMR: Reinforce- ment Learning with Verifiable Meta-Reasoning Rewards for Robust Long-Horizon Agents","venue":"arXiv (Cornell University)","work_id":"e1c07e12-4ba6-4121-83b1-0e11a23f6a46","year":2025},"citing_paper":{"arxiv_id":"2606.26935","last_updated":"2026-06-25T12:09:16Z","snapshot_observed_at":"2026-08-05T08:46:41.476055Z","submitted_at":"2026-06-25T12:09:16Z","title":"Where Do CoT Training Gains Land in LLM based Agents?","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-06-26T04:55:14.293452Z"},"links":{"cited_paper":"/paper/2507.22844","citing_paper":"/paper/2606.26935"},"observation_digest":"sha256:09ed5032a8dbf92122c2d6002e3380813d1a6d95414ffec487ac109b4dc78038","observation_id":"578e9c1e-430f-4a6a-84b3-78e2a06df079","resolution":{"observed_at":"2026-07-04T13:49:51.517553Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-05-22T15:52:33.637506+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-22T15:52:33.637506+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.22844","last_updated":"2025-07-30T17:00:48Z","snapshot_observed_at":"2026-08-07T22:42:41.639384Z","submitted_at":"2025-07-30T17:00:48Z","title":"RLVMR: Reinforcement Learning with Verifiable Meta-Reasoning Rewards for Robust Long-Horizon Agents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.22844","snapshot_observed_at":"2026-07-11T14:43:39.668059Z","title":"Rlvmr: Reinforce- ment learning with verifiable meta-reasoning rewards for robust long-horizon agents.arXiv preprint arXiv:2507.22844, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.04713","last_updated":"2026-07-06T06:32:39Z","snapshot_observed_at":"2026-08-07T20:40:56.219597Z","submitted_at":"2026-07-06T06:32:39Z","title":"RSPO: Reward-Swap Policy Optimization for Multi-Turn LLM Agents","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-07-11T14:43:39.668059Z"},"links":{"cited_paper":"/paper/2507.22844","citing_paper":"/paper/2607.04713"},"observation_digest":"sha256:945695f18da686efad0fdb93c685930933947d4391abdc32612d28d4737f4add","observation_id":"ac00b5aa-cc46-41ed-bd85-c273d00a1419","resolution":{"observed_at":"2026-07-11T14:43:39.668059Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.22844","last_updated":"2025-07-30T17:00:48Z","snapshot_observed_at":"2026-08-07T22:42:41.639384Z","submitted_at":"2025-07-30T17:00:48Z","title":"RLVMR: Reinforcement Learning with Verifiable Meta-Reasoning Rewards for Robust Long-Horizon Agents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.22844","snapshot_observed_at":"2026-07-11T10:50:54.419477Z","title":"arXiv preprint arXiv:2507.22844 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04963","last_updated":"2026-07-06T11:50:06Z","snapshot_observed_at":"2026-08-03T04:57:20.508738Z","submitted_at":"2026-07-06T11:50:06Z","title":"STAPO: Selective Trajectory-Aware Policy Optimization for LLM Agent Training","version":1},"reference_index":97,"source":"arxiv_source","source_observed_at":"2026-07-11T10:50:54.419477Z"},"links":{"cited_paper":"/paper/2507.22844","citing_paper":"/paper/2607.04963"},"observation_digest":"sha256:df1311a13baf7225b69390e2722797b8b8b8a6fe242b3b8f19b5052c7ac59c28","observation_id":"f39e0090-b9af-40e9-bb51-fdc755be7ea1","resolution":{"observed_at":"2026-07-11T10:50:54.419477Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.22844","last_updated":"2025-07-30T17:00:48Z","snapshot_observed_at":"2026-08-07T22:42:41.639384Z","submitted_at":"2025-07-30T17:00:48Z","title":"RLVMR: Reinforcement Learning with Verifiable Meta-Reasoning Rewards for Robust Long-Horizon Agents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.22844","snapshot_observed_at":"2026-07-31T21:44:39.696164Z","title":"Rlvmr: Reinforce- ment learning with verifiable meta-reasoning rewards for robust long-horizon agents.arXiv preprint arXiv:2507.22844, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.27973","last_updated":"2026-07-30T10:17:55Z","snapshot_observed_at":"2026-08-08T00:19:31.081356Z","submitted_at":"2026-07-30T10:17:55Z","title":"TAPO: Transition-Aware Policy Optimization for LLM Agents","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-07-31T21:44:39.696164Z"},"links":{"cited_paper":"/paper/2507.22844","citing_paper":"/paper/2607.27973"},"observation_digest":"sha256:05979a6bcef8d3255143ce6421f4b8c8f782527ebbba79a58de429b81d15d5c9","observation_id":"6198f19b-ce98-49eb-b616-8555e4fa7ad7","resolution":{"observed_at":"2026-07-31T21:44:39.696164Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.22844","last_updated":"2025-07-30T17:00:48Z","snapshot_observed_at":"2026-08-07T22:42:41.639384Z","submitted_at":"2025-07-30T17:00:48Z","title":"RLVMR: Reinforcement Learning with Verifiable Meta-Reasoning Rewards for Robust Long-Horizon Agents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.22844","snapshot_observed_at":"2026-08-06T04:30:45.506154Z","title":"RLVMR: Reinforcement learning with verifiable meta-reasoning rewards for robust long-horizon agents.arXiv preprint arXiv:2507.22844, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.05139","last_updated":"2026-08-05T17:57:16Z","snapshot_observed_at":"2026-08-09T12:43:19.697158Z","submitted_at":"2026-08-05T17:57:16Z","title":"Toward Skill-Native LLMs: Skill Entropy for Benchmarking and Training Long-Horizon Reasoning","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-06T04:30:45.506154Z"},"links":{"cited_paper":"/paper/2507.22844","citing_paper":"/paper/2608.05139"},"observation_digest":"sha256:455f8f410b0a0e2fdb8884ed630deb14260b0f5e33e1cb527b563bb175deedcf","observation_id":"0506bd30-63bc-448a-84f7-bf8d05965137","resolution":{"observed_at":"2026-08-06T04:30:45.506154Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2507.22844/citation-record","integrity":"/paper/2507.22844/integrity","json":"/paper/2507.22844/citation-record.json","paper":"/paper/2507.22844"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:21:24.792677Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.22844","last_updated":"2025-07-30T17:00:48Z","snapshot_observed_at":"2026-08-07T22:42:41.639384Z","submitted_at":"2025-07-30T17:00:48Z","title":"RLVMR: Reinforcement Learning with Verifiable Meta-Reasoning Rewards for Robust Long-Horizon Agents","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-06T11:21:24.792677Z"},"links":{"citing_paper":"/paper/2507.22844"},"observation_digest":"sha256:b17ad45b0cfa3832bd3f7f45a0554af50ef07733eedcf196e5ccadff1911e913","observation_id":"e7c58f48-76bb-413a-98aa-c35e51c3c875","resolution":{"observed_at":"2026-08-06T11:21:24.792677Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.13032","last_updated":"2024-07-17T21:44:28Z","snapshot_observed_at":"2026-08-07T16:45:05.155981Z","submitted_at":"2024-07-17T21:44:28Z","title":"Agent-E: From Autonomous Web Navigation to Foundational Design Principles in Agentic Systems","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.13032","snapshot_observed_at":"2026-08-06T11:21:24.872638Z","title":"Agent-e: From autonomous web navigation to foundational design principles in agentic systems","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.22844","last_updated":"2025-07-30T17:00:48Z","snapshot_observed_at":"2026-08-07T22:42:41.639384Z","submitted_at":"2025-07-30T17:00:48Z","title":"RLVMR: Reinforcement Learning with Verifiable Meta-Reasoning Rewards for Robust Long-Horizon Agents","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-06T11:21:24.872638Z"},"links":{"cited_paper":"/paper/2407.13032","citing_paper":"/paper/2507.22844"},"observation_digest":"sha256:136544f3e3264e0d7f256d0b16eecd543388fbef5b3ce953461993ade271c6cd","observation_id":"72841eb2-0aa8-436d-b40a-c3721397a918","resolution":{"observed_at":"2026-08-06T11:21:24.872638Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.08164","last_updated":"2024-10-10T17:43:51Z","snapshot_observed_at":"2026-07-06T19:31:23.072307Z","submitted_at":"2024-10-10T17:43:51Z","title":"Agent S: An Open Agentic Framework that Uses Computers Like a Human","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.08164","snapshot_observed_at":"2026-08-06T11:21:24.987699Z","title":"Agent s: An open agentic framework that uses computers like a human","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.22844","last_updated":"2025-07-30T17:00:48Z","snapshot_observed_at":"2026-08-07T22:42:41.639384Z","submitted_at":"2025-07-30T17:00:48Z","title":"RLVMR: Reinforcement Learning with Verifiable Meta-Reasoning Rewards for Robust Long-Horizon Agents","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-06T11:21:24.987699Z"},"links":{"cited_paper":"/paper/2410.08164","citing_paper":"/paper/2507.22844"},"observation_digest":"sha256:42041af39409621a441d421280c3e9a3c994c09216efbe5a6fced9826564ac94","observation_id":"9dc625d8-f4ac-4e88-9ede-8385014f4c27","resolution":{"observed_at":"2026-08-06T11:21:24.987699Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:21:25.067188Z","title":"Digirl: Training in-the-wild device-control agents with autonomous reinforcement learning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.22844","last_updated":"2025-07-30T17:00:48Z","snapshot_observed_at":"2026-08-07T22:42:41.639384Z","submitted_at":"2025-07-30T17:00:48Z","title":"RLVMR: Reinforcement Learning with Verifiable Meta-Reasoning Rewards for Robust Long-Horizon Agents","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-06T11:21:25.067188Z"},"links":{"citing_paper":"/paper/2507.22844"},"observation_digest":"sha256:8f6f29f0b747fa4bc01e723af847deb04f23fb5db87fd29c7daabf118be3da2a","observation_id":"f424d337-8c80-48a4-bd9c-b09ce0e5aaff","resolution":{"observed_at":"2026-08-06T11:21:25.067188Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.17161","last_updated":"2025-05-26T17:16:45Z","snapshot_observed_at":"2026-08-09T18:26:12.869738Z","submitted_at":"2025-01-28T18:59:44Z","title":"SFT Memorizes, RL Generalizes: A Comparative Study of Foundation Model Post-training","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.17161","snapshot_observed_at":"2026-08-06T11:21:25.125749Z","title":"Sft memorizes, rl generalizes: A comparative study of foundation model post-training","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.22844","last_updated":"2025-07-30T17:00:48Z","snapshot_observed_at":"2026-08-07T22:42:41.639384Z","submitted_at":"2025-07-30T17:00:48Z","title":"RLVMR: Reinforcement Learning with Verifiable Meta-Reasoning Rewards for Robust Long-Horizon Agents","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-06T11:21:25.125749Z"},"links":{"cited_paper":"/paper/2501.17161","citing_paper":"/paper/2507.22844"},"observation_digest":"sha256:1f51a8af347c183b1d0f0e3a9d0b8be7c9d16cb72f5e9aba451e7d2c02a724b5","observation_id":"5674a6bd-a0c9-4192-9ca1-59e68115dd09","resolution":{"observed_at":"2026-08-06T11:21:25.125749Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.10978","last_updated":"2025-10-28T15:11:36Z","snapshot_observed_at":"2026-07-29T19:20:21.974239Z","submitted_at":"2025-05-16T08:26:59Z","title":"Group-in-Group Policy Optimization for LLM Agent Training","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.10978","snapshot_observed_at":"2026-08-06T11:21:25.329821Z","title":"Group-in-group policy optimization for llm agent training","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.22844","last_updated":"2025-07-30T17:00:48Z","snapshot_observed_at":"2026-08-07T22:42:41.639384Z","submitted_at":"2025-07-30T17:00:48Z","title":"RLVMR: Reinforcement Learning with Verifiable Meta-Reasoning Rewards for Robust Long-Horizon Agents","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-06T11:21:25.329821Z"},"links":{"cited_paper":"/paper/2505.10978","citing_paper":"/paper/2507.22844"},"observation_digest":"sha256:c5a4341bbe9e738f241a29cad75b145a72e203344fd9148b1034ef162eb8c877","observation_id":"44cf0d7b-ee2a-4185-b330-e95e284b7f69","resolution":{"observed_at":"2026-08-06T11:21:25.329821Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.01702","last_updated":"2025-02-24T12:42:14Z","snapshot_observed_at":"2026-08-09T09:13:49.168391Z","submitted_at":"2025-01-03T08:55:19Z","title":"AgentRefine: Enhancing Agent Generalization through Refinement Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.01702","snapshot_observed_at":"2026-08-06T11:21:25.444678Z","title":"Agentrefine: Enhancing agent generalization through refinement tuning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.22844","last_updated":"2025-07-30T17:00:48Z","snapshot_observed_at":"2026-08-07T22:42:41.639384Z","submitted_at":"2025-07-30T17:00:48Z","title":"RLVMR: Reinforcement Learning with Verifiable Meta-Reasoning Rewards for Robust Long-Horizon Agents","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-06T11:21:25.444678Z"},"links":{"cited_paper":"/paper/2501.01702","citing_paper":"/paper/2507.22844"},"observation_digest":"sha256:a9182eda3fee69cf2a58fc6dafe33b3e2b80a1d78cf99a85378f6a836cd2e6c2","observation_id":"6a5dedfc-061a-41d8-b712-4157991f9fe6","resolution":{"observed_at":"2026-08-06T11:21:25.444678Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.24290","last_updated":"2025-07-05T09:01:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-31T16:36:05Z","title":"Open-Reasoner-Zero: An Open Source Approach to Scaling Up Reinforcement Learning on the Base Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.24290","snapshot_observed_at":"2026-08-06T11:21:25.567372Z","title":"Open-reasoner-zero: An open source approach to scaling up reinforcement learning on the base model","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.22844","last_updated":"2025-07-30T17:00:48Z","snapshot_observed_at":"2026-08-07T22:42:41.639384Z","submitted_at":"2025-07-30T17:00:48Z","title":"RLVMR: Reinforcement Learning with Verifiable Meta-Reasoning Rewards for Robust Long-Horizon Agents","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-06T11:21:25.567372Z"},"links":{"cited_paper":"/paper/2503.24290","citing_paper":"/paper/2507.22844"},"observation_digest":"sha256:3c3d4d4e232825cb0e67491cf3106d3dbfdd96dfd73120b46466a7b1ef67cf52","observation_id":"18f457d4-de31-4c72-9787-60e7588b2d40","resolution":{"observed_at":"2026-08-06T11:21:25.567372Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.13010","last_updated":"2024-05-24T11:47:24Z","snapshot_observed_at":"2026-07-06T17:05:56.282078Z","submitted_at":"2023-12-20T13:22:41Z","title":"AgentCoder: Multi-Agent-based Code Generation with Iterative Testing and Optimisation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.13010","snapshot_observed_at":"2026-08-06T11:21:25.638167Z","title":"Agentcoder: Multi-agent-based code generation with iterative testing and optimisation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.22844","last_updated":"2025-07-30T17:00:48Z","snapshot_observed_at":"2026-08-07T22:42:41.639384Z","submitted_at":"2025-07-30T17:00:48Z","title":"RLVMR: Reinforcement Learning with Verifiable Meta-Reasoning Rewards for Robust Long-Horizon Agents","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-06T11:21:25.638167Z"},"links":{"cited_paper":"/paper/2312.13010","citing_paper":"/paper/2507.22844"},"observation_digest":"sha256:f2d2669f77d5b4d2c562f46975d6d40e5656a00a331fc7340ef5d3b5d9f3af80","observation_id":"5a35479b-97f9-44cd-9b9e-a06361e5caf5","resolution":{"observed_at":"2026-08-06T11:21:25.638167Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:21:25.727837Z","title":"Metacognition: A literature review","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2507.22844","last_updated":"2025-07-30T17:00:48Z","snapshot_observed_at":"2026-08-07T22:42:41.639384Z","submitted_at":"2025-07-30T17:00:48Z","title":"RLVMR: Reinforcement Learning with Verifiable Meta-Reasoning Rewards for Robust Long-Horizon Agents","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-06T11:21:25.727837Z"},"links":{"citing_paper":"/paper/2507.22844"},"observation_digest":"sha256:84302940c9052be7ad891787303b925137bf57554f71fe5db6580ca1b8c28a06","observation_id":"0fc1466c-d69b-4818-89f7-d6e44b0c8948","resolution":{"observed_at":"2026-08-06T11:21:25.727837Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20783","last_updated":"2025-10-06T09:30:03Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-26T17:59:14Z","title":"Understanding R1-Zero-Like Training: A Critical Perspective","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.20783","snapshot_observed_at":"2026-08-06T11:21:25.854273Z","title":"Understanding r1-zero-like training: A critical perspective","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.22844","last_updated":"2025-07-30T17:00:48Z","snapshot_observed_at":"2026-08-07T22:42:41.639384Z","submitted_at":"2025-07-30T17:00:48Z","title":"RLVMR: Reinforcement Learning with Verifiable Meta-Reasoning Rewards for Robust Long-Horizon Agents","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-06T11:21:25.854273Z"},"links":{"cited_paper":"/paper/2503.20783","citing_paper":"/paper/2507.22844"},"observation_digest":"sha256:42e0585a7edde2c26f57f3817a3c9f76030b61e45c3031ad7fe75708a7f557d1","observation_id":"cde1e6f9-84a8-428e-b73f-c8c6931e5a7a","resolution":{"observed_at":"2026-08-06T11:21:25.854273Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:21:30.164748Z","title":"What is metacognition? Phi delta kappan, 87 0 (9): 0 696--699, 2006","venue":null,"work_id":"b7565dff-3705-4a15-bd79-cca7b6323a0e","year":2006},"citing_paper":{"arxiv_id":"2507.22844","last_updated":"2025-07-30T17:00:48Z","snapshot_observed_at":"2026-08-07T22:42:41.639384Z","submitted_at":"2025-07-30T17:00:48Z","title":"RLVMR: Reinforcement Learning with Verifiable Meta-Reasoning Rewards for Robust Long-Horizon Agents","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-06T11:21:25.985422Z"},"links":{"citing_paper":"/paper/2507.22844"},"observation_digest":"sha256:80bfa1fdb9083152904e9d78164fc038ae273aa9694ff1846789641cd38bdf0f","observation_id":"817d8432-6a6f-4089-8efc-f47b2bf6237f","resolution":{"observed_at":"2026-08-06T11:21:30.281687Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.19393","last_updated":"2025-03-01T06:07:39Z","snapshot_observed_at":"2026-07-06T20:29:11.710285Z","submitted_at":"2025-01-31T18:48:08Z","title":"s1: Simple test-time scaling","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.19393","snapshot_observed_at":"2026-08-06T11:21:26.067539Z","title":"s1: Simple test-time scaling","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.22844","last_updated":"2025-07-30T17:00:48Z","snapshot_observed_at":"2026-08-07T22:42:41.639384Z","submitted_at":"2025-07-30T17:00:48Z","title":"RLVMR: Reinforcement Learning with Verifiable Meta-Reasoning Rewards for Robust Long-Horizon Agents","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-06T11:21:26.067539Z"},"links":{"cited_paper":"/paper/2501.19393","citing_paper":"/paper/2507.22844"},"observation_digest":"sha256:72e958476732789067d13218a747eccbaf7e9e400e3790607402c79cb2348ac6","observation_id":"007c1f90-e20e-4186-91c2-bda3619ad0a0","resolution":{"observed_at":"2026-08-06T11:21:26.067539Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:21:26.137344Z","title":"Training language models to follow instructions with human feedback","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.22844","last_updated":"2025-07-30T17:00:48Z","snapshot_observed_at":"2026-08-07T22:42:41.639384Z","submitted_at":"2025-07-30T17:00:48Z","title":"RLVMR: Reinforcement Learning with Verifiable Meta-Reasoning Rewards for Robust Long-Horizon Agents","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-06T11:21:26.137344Z"},"links":{"citing_paper":"/paper/2507.22844"},"observation_digest":"sha256:8b6a9c6a769a3608a2cc7674c3be134ab751edcf1337ec41005d8dd2506ac2f5","observation_id":"374bf8bd-f7b8-4394-ad92-958409523872","resolution":{"observed_at":"2026-08-06T11:21:26.137344Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:21:29.972697Z","title":"Agent planning with world knowledge model","venue":null,"work_id":"fdc116d0-93a4-4b85-b2e7-b551a43c19f4","year":2024},"citing_paper":{"arxiv_id":"2507.22844","last_updated":"2025-07-30T17:00:48Z","snapshot_observed_at":"2026-08-07T22:42:41.639384Z","submitted_at":"2025-07-30T17:00:48Z","title":"RLVMR: Reinforcement Learning with Verifiable Meta-Reasoning Rewards for Robust Long-Horizon Agents","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-06T11:21:26.223002Z"},"links":{"citing_paper":"/paper/2507.22844"},"observation_digest":"sha256:3aea4d2274b117a984bbfc7d9ce3b0fe1f563d3d7e56e0e0bad64680365ea812","observation_id":"061d84b4-3439-411b-9caf-109d8861021b","resolution":{"observed_at":"2026-08-06T11:21:30.038442Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:21:26.314995Z","title":"Toolllm: Facilitating large language models to master 16000+ real-world apis","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.22844","last_updated":"2025-07-30T17:00:48Z","snapshot_observed_at":"2026-08-07T22:42:41.639384Z","submitted_at":"2025-07-30T17:00:48Z","title":"RLVMR: Reinforcement Learning with Verifiable Meta-Reasoning Rewards for Robust Long-Horizon Agents","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-06T11:21:26.314995Z"},"links":{"citing_paper":"/paper/2507.22844"},"observation_digest":"sha256:400851d63c92320013a67c9fe420d8f143ea14a479bef10b30a6c84f70ba9c01","observation_id":"18d5201c-9847-4104-af5f-a46c1601b22d","resolution":{"observed_at":"2026-08-06T11:21:26.314995Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:21:26.421243Z","title":"Direct preference optimization: Your language model is secretly a reward model","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.22844","last_updated":"2025-07-30T17:00:48Z","snapshot_observed_at":"2026-08-07T22:42:41.639384Z","submitted_at":"2025-07-30T17:00:48Z","title":"RLVMR: Reinforcement Learning with Verifiable Meta-Reasoning Rewards for Robust Long-Horizon Agents","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-06T11:21:26.421243Z"},"links":{"citing_paper":"/paper/2507.22844"},"observation_digest":"sha256:cc97e34bec80ea96014c54f81f8371571664ffe5d9251ca43cf641d1be0bbb4c","observation_id":"51f230ed-348e-4100-9b70-4447b6362e8a","resolution":{"observed_at":"2026-08-06T11:21:26.421243Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-06T11:21:26.503078Z","title":"Proximal policy optimization algorithms","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.22844","last_updated":"2025-07-30T17:00:48Z","snapshot_observed_at":"2026-08-07T22:42:41.639384Z","submitted_at":"2025-07-30T17:00:48Z","title":"RLVMR: Reinforcement Learning with Verifiable Meta-Reasoning Rewards for Robust Long-Horizon Agents","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-06T11:21:26.503078Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2507.22844"},"observation_digest":"sha256:6f1b36ac565e0498ce7d4022c3c99e4675277ac1bcd9162357393c606133ae47","observation_id":"8d481db7-b25b-40e1-9bfe-246c62bd71f2","resolution":{"observed_at":"2026-08-06T11:21:26.503078Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:21:26.592831Z","title":"Reflexion: Language agents with verbal reinforcement learning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.22844","last_updated":"2025-07-30T17:00:48Z","snapshot_observed_at":"2026-08-07T22:42:41.639384Z","submitted_at":"2025-07-30T17:00:48Z","title":"RLVMR: Reinforcement Learning with Verifiable Meta-Reasoning Rewards for Robust Long-Horizon Agents","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-06T11:21:26.592831Z"},"links":{"citing_paper":"/paper/2507.22844"},"observation_digest":"sha256:2f8e4ca0379bcbf2e1547c7cfff64550ac077aacb29ad29075219c8fcd60e115","observation_id":"112a0911-c508-46da-9e21-daae599e1215","resolution":{"observed_at":"2026-08-06T11:21:26.592831Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.03768","last_updated":"2021-03-14T22:44:38Z","snapshot_observed_at":"2026-08-08T17:40:47.037804Z","submitted_at":"2020-10-08T05:13:36Z","title":"ALFWorld: Aligning Text and Embodied Environments for Interactive Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.03768","snapshot_observed_at":"2026-08-06T11:21:26.682417Z","title":"Alfworld: Aligning text and embodied environments for interactive learning","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2507.22844","last_updated":"2025-07-30T17:00:48Z","snapshot_observed_at":"2026-08-07T22:42:41.639384Z","submitted_at":"2025-07-30T17:00:48Z","title":"RLVMR: Reinforcement Learning with Verifiable Meta-Reasoning Rewards for Robust Long-Horizon Agents","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-06T11:21:26.682417Z"},"links":{"cited_paper":"/paper/2010.03768","citing_paper":"/paper/2507.22844"},"observation_digest":"sha256:e5c798e5fdf7d818ba0e44711b6ac7ca73b546342d77c938a1913e086de3ede7","observation_id":"dfcea7cb-7364-4fa2-9355-f9cb34de8804","resolution":{"observed_at":"2026-08-06T11:21:26.682417Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.02502","last_updated":"2024-07-10T17:36:25Z","snapshot_observed_at":"2026-08-07T22:37:26.229203Z","submitted_at":"2024-03-04T21:50:29Z","title":"Trial and Error: Exploration-Based Trajectory Optimization for LLM Agents","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.02502","snapshot_observed_at":"2026-08-06T11:21:26.783454Z","title":"Trial and error: Exploration-based trajectory optimization for llm agents","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.22844","last_updated":"2025-07-30T17:00:48Z","snapshot_observed_at":"2026-08-07T22:42:41.639384Z","submitted_at":"2025-07-30T17:00:48Z","title":"RLVMR: Reinforcement Learning with Verifiable Meta-Reasoning Rewards for Robust Long-Horizon Agents","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-06T11:21:26.783454Z"},"links":{"cited_paper":"/paper/2403.02502","citing_paper":"/paper/2507.22844"},"observation_digest":"sha256:eb8482346e2a61f35064481b775c75d0e4f8ca7028cf31389199a53bbfd7e71d","observation_id":"2a88c7ea-1fe7-4db2-a16c-6ba094467c5d","resolution":{"observed_at":"2026-08-06T11:21:26.783454Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.05301","last_updated":"2023-09-07T12:20:45Z","snapshot_observed_at":"2026-07-06T15:40:20.267344Z","submitted_at":"2023-06-08T15:46:32Z","title":"ToolAlpaca: Generalized Tool Learning for Language Models with 3000 Simulated Cases","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.05301","snapshot_observed_at":"2026-08-06T11:21:26.873512Z","title":"Toolalpaca: Generalized tool learning for language models with 3000 simulated cases","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.22844","last_updated":"2025-07-30T17:00:48Z","snapshot_observed_at":"2026-08-07T22:42:41.639384Z","submitted_at":"2025-07-30T17:00:48Z","title":"RLVMR: Reinforcement Learning with Verifiable Meta-Reasoning Rewards for Robust Long-Horizon Agents","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-06T11:21:26.873512Z"},"links":{"cited_paper":"/paper/2306.05301","citing_paper":"/paper/2507.22844"},"observation_digest":"sha256:1de19c3a25f21466c5b2e5ba9f50f7b1f5d721102735346c6a7a2bf9d48cb07f","observation_id":"d29c7ebc-a2f0-4396-8f4c-2eb7f8f98d5e","resolution":{"observed_at":"2026-08-06T11:21:26.873512Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:21:26.966172Z","title":"Rlver: Reinforcement learning with verifiable emotion rewards for empathetic agents, 2025 a","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.22844","last_updated":"2025-07-30T17:00:48Z","snapshot_observed_at":"2026-08-07T22:42:41.639384Z","submitted_at":"2025-07-30T17:00:48Z","title":"RLVMR: Reinforcement Learning with Verifiable Meta-Reasoning Rewards for Robust Long-Horizon Agents","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-06T11:21:26.966172Z"},"links":{"citing_paper":"/paper/2507.22844"},"observation_digest":"sha256:79ab81e71621f01828f2536c286ee7b3ec7df5da9c4e1a7b8ccf1f0001f9ba13","observation_id":"d6640c1a-146f-451c-a166-5b508956f7d4","resolution":{"observed_at":"2026-08-06T11:21:26.966172Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.07540","last_updated":"2022-11-14T17:52:27Z","snapshot_observed_at":"2026-08-06T07:25:42.562786Z","submitted_at":"2022-03-14T22:52:34Z","title":"ScienceWorld: Is your Agent Smarter than a 5th Grader?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.07540","snapshot_observed_at":"2026-08-06T11:21:27.035759Z","title":"Scienceworld: Is your agent smarter than a 5th grader? arXiv preprint arXiv:2203.07540, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.22844","last_updated":"2025-07-30T17:00:48Z","snapshot_observed_at":"2026-08-07T22:42:41.639384Z","submitted_at":"2025-07-30T17:00:48Z","title":"RLVMR: Reinforcement Learning with Verifiable Meta-Reasoning Rewards for Robust Long-Horizon Agents","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-06T11:21:27.035759Z"},"links":{"cited_paper":"/paper/2203.07540","citing_paper":"/paper/2507.22844"},"observation_digest":"sha256:650c8b1801c3b3e9381b0cd610735c9f37199a385e221e289d2624de144d0985","observation_id":"1167c757-ae55-4ed4-8b77-4258b14823ad","resolution":{"observed_at":"2026-08-06T11:21:27.035759Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.20073","last_updated":"2025-05-26T17:19:30Z","snapshot_observed_at":"2026-08-08T11:44:11.313729Z","submitted_at":"2025-04-24T17:57:08Z","title":"RAGEN: Understanding Self-Evolution in LLM Agents via Multi-Turn Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.20073","snapshot_observed_at":"2026-08-06T11:21:27.115747Z","title":"Ragen: Understanding self-evolution in llm agents via multi-turn reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.22844","last_updated":"2025-07-30T17:00:48Z","snapshot_observed_at":"2026-08-07T22:42:41.639384Z","submitted_at":"2025-07-30T17:00:48Z","title":"RLVMR: Reinforcement Learning with Verifiable Meta-Reasoning Rewards for Robust Long-Horizon Agents","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-06T11:21:27.115747Z"},"links":{"cited_paper":"/paper/2504.20073","citing_paper":"/paper/2507.22844"},"observation_digest":"sha256:e22d4bc741367d0346d4463085cc9cdf7fea618c3321ecfcd655fc9a8cfef9f5","observation_id":"fecd4649-0c8e-472b-b9fe-1391c4ebe95b","resolution":{"observed_at":"2026-08-06T11:21:27.115747Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04151","last_updated":"2024-06-06T15:15:41Z","snapshot_observed_at":"2026-08-09T08:52:31.974183Z","submitted_at":"2024-06-06T15:15:41Z","title":"AgentGym: Evolving Large Language Model-based Agents across Diverse Environments","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.04151","snapshot_observed_at":"2026-08-06T11:21:27.211465Z","title":"Agentgym: Evolving large language model-based agents across diverse environments","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.22844","last_updated":"2025-07-30T17:00:48Z","snapshot_observed_at":"2026-08-07T22:42:41.639384Z","submitted_at":"2025-07-30T17:00:48Z","title":"RLVMR: Reinforcement Learning with Verifiable Meta-Reasoning Rewards for Robust Long-Horizon Agents","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-06T11:21:27.211465Z"},"links":{"cited_paper":"/paper/2406.04151","citing_paper":"/paper/2507.22844"},"observation_digest":"sha256:ebedc3a5346cff4da5d0772f0d639b63fd5222ede9b893d58b75fcb04daf1cba","observation_id":"68c40d27-ad2e-4f13-ad10-91e3b1feebb7","resolution":{"observed_at":"2026-08-06T11:21:27.211465Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:21:29.777685Z","title":"Watch every step! llm agent learning via iterative step-level process refinement","venue":null,"work_id":"2eac5b95-eefa-478b-9ac3-6c1f5d550f8e","year":2024},"citing_paper":{"arxiv_id":"2507.22844","last_updated":"2025-07-30T17:00:48Z","snapshot_observed_at":"2026-08-07T22:42:41.639384Z","submitted_at":"2025-07-30T17:00:48Z","title":"RLVMR: Reinforcement Learning with Verifiable Meta-Reasoning Rewards for Robust Long-Horizon Agents","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-06T11:21:27.280991Z"},"links":{"citing_paper":"/paper/2507.22844"},"observation_digest":"sha256:bdd17a0643d863c9d9f2152db2e292b8edd6e02c2aafa65e49e9dc6ab7183c96","observation_id":"53bb5053-9869-445c-bca5-48a438f958b9","resolution":{"observed_at":"2026-08-06T11:21:29.861644Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:21:29.572637Z","title":"Gpt4tools: Teaching large language model to use tools via self-instruction","venue":null,"work_id":"4f64850c-ce8e-4523-b285-215cce2b3009","year":2023},"citing_paper":{"arxiv_id":"2507.22844","last_updated":"2025-07-30T17:00:48Z","snapshot_observed_at":"2026-08-07T22:42:41.639384Z","submitted_at":"2025-07-30T17:00:48Z","title":"RLVMR: Reinforcement Learning with Verifiable Meta-Reasoning Rewards for Robust Long-Horizon Agents","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-06T11:21:27.338862Z"},"links":{"citing_paper":"/paper/2507.22844"},"observation_digest":"sha256:0c831200c2005d77d49d70dbde05dd1e848d6e44a275ace3327270148eb006ab","observation_id":"b9d66c38-59b3-44df-90a4-7ab831707a05","resolution":{"observed_at":"2026-08-06T11:21:29.668964Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:21:27.421252Z","title":"React: Synergizing reasoning and acting in language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.22844","last_updated":"2025-07-30T17:00:48Z","snapshot_observed_at":"2026-08-07T22:42:41.639384Z","submitted_at":"2025-07-30T17:00:48Z","title":"RLVMR: Reinforcement Learning with Verifiable Meta-Reasoning Rewards for Robust Long-Horizon Agents","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-06T11:21:27.421252Z"},"links":{"citing_paper":"/paper/2507.22844"},"observation_digest":"sha256:860e7725e25d1d2181eb9d6ecb4a4cecffb3809f22c5ecbbf730594d4e4fc3e3","observation_id":"e2ce4d8a-523d-4628-9b25-cbf8384ce39d","resolution":{"observed_at":"2026-08-06T11:21:27.421252Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14476","last_updated":"2025-05-20T01:37:34Z","snapshot_observed_at":"2026-08-02T01:40:54.187278Z","submitted_at":"2025-03-18T17:49:06Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.14476","snapshot_observed_at":"2026-08-06T11:21:27.471376Z","title":"Dapo: An open-source llm reinforcement learning system at scale","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.22844","last_updated":"2025-07-30T17:00:48Z","snapshot_observed_at":"2026-08-07T22:42:41.639384Z","submitted_at":"2025-07-30T17:00:48Z","title":"RLVMR: Reinforcement Learning with Verifiable Meta-Reasoning Rewards for Robust Long-Horizon Agents","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-06T11:21:27.471376Z"},"links":{"cited_paper":"/paper/2503.14476","citing_paper":"/paper/2507.22844"},"observation_digest":"sha256:f98fda7d960e8b106bfe9e797907d38aa1f3c4570fc240888fc5ebaecfe3d461","observation_id":"73c28fc9-fde8-4682-b1d7-5de80f019aea","resolution":{"observed_at":"2026-08-06T11:21:27.471376Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:21:29.331839Z","title":"Steptool: A step-grained reinforcement learning framework for tool learning in llms","venue":null,"work_id":"952eab46-9613-46cb-b582-a63da3e040e6","year":2024},"citing_paper":{"arxiv_id":"2507.22844","last_updated":"2025-07-30T17:00:48Z","snapshot_observed_at":"2026-08-07T22:42:41.639384Z","submitted_at":"2025-07-30T17:00:48Z","title":"RLVMR: Reinforcement Learning with Verifiable Meta-Reasoning Rewards for Robust Long-Horizon Agents","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-06T11:21:27.587989Z"},"links":{"citing_paper":"/paper/2507.22844"},"observation_digest":"sha256:ed590a1ab49f64cf77439ec792f262f565e80d1270fcd4a2de92dfa5038e2729","observation_id":"47c97e62-e927-4e3c-b70f-fb2bdc07b4b2","resolution":{"observed_at":"2026-08-06T11:21:29.450056Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.11425","last_updated":"2025-03-24T10:18:56Z","snapshot_observed_at":"2026-07-06T20:23:22.709846Z","submitted_at":"2025-01-20T11:46:04Z","title":"Agent-R: Training Language Model Agents to Reflect via Iterative Self-Training","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.11425","snapshot_observed_at":"2026-08-06T11:21:27.676834Z","title":"Agent-r: Training language model agents to reflect via iterative self-training","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.22844","last_updated":"2025-07-30T17:00:48Z","snapshot_observed_at":"2026-08-07T22:42:41.639384Z","submitted_at":"2025-07-30T17:00:48Z","title":"RLVMR: Reinforcement Learning with Verifiable Meta-Reasoning Rewards for Robust Long-Horizon Agents","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-06T11:21:27.676834Z"},"links":{"cited_paper":"/paper/2501.11425","citing_paper":"/paper/2507.22844"},"observation_digest":"sha256:c481dff3b9066e9802015a1878bcb0f79552cae548e0dd57ad06118de3948c00","observation_id":"51204792-88b2-4000-8f53-bc77a7647bbc","resolution":{"observed_at":"2026-08-06T11:21:27.676834Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:21:29.209014Z","title":"Agenttuning: Enabling generalized agent abilities for llms","venue":null,"work_id":"2ac5fc7b-0a51-4d1f-bcc2-6787f1185fc5","year":2024},"citing_paper":{"arxiv_id":"2507.22844","last_updated":"2025-07-30T17:00:48Z","snapshot_observed_at":"2026-08-07T22:42:41.639384Z","submitted_at":"2025-07-30T17:00:48Z","title":"RLVMR: Reinforcement Learning with Verifiable Meta-Reasoning Rewards for Robust Long-Horizon Agents","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-06T11:21:27.740567Z"},"links":{"citing_paper":"/paper/2507.22844"},"observation_digest":"sha256:1d4b6053b610e7adeea1040e4a2f26c4ea91d7723665a3b841e7fe46e13587f0","observation_id":"068f6e9c-9c79-462c-83e9-a33b13845154","resolution":{"observed_at":"2026-08-06T11:21:29.284262Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.02847","last_updated":"2025-05-21T13:45:40Z","snapshot_observed_at":"2026-08-09T11:26:07.672158Z","submitted_at":"2025-05-01T19:06:10Z","title":"Sentient Agent as a Judge: Evaluating Higher-Order Social Cognition in Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.02847","snapshot_observed_at":"2026-08-06T11:21:27.805649Z","title":"Sentient agent as a judge: Evaluating higher-order social cognition in large language models, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.22844","last_updated":"2025-07-30T17:00:48Z","snapshot_observed_at":"2026-08-07T22:42:41.639384Z","submitted_at":"2025-07-30T17:00:48Z","title":"RLVMR: Reinforcement Learning with Verifiable Meta-Reasoning Rewards for Robust Long-Horizon Agents","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-06T11:21:27.805649Z"},"links":{"cited_paper":"/paper/2505.02847","citing_paper":"/paper/2507.22844"},"observation_digest":"sha256:f536c37b2d794d2fd96a0439fe5b114de66ce38f185c3de4ed61fb7d844583b5","observation_id":"9af3635a-dd82-4606-a094-4d03986b4492","resolution":{"observed_at":"2026-08-06T11:21:27.805649Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:21:27.893716Z","title":"Codeagent: Enhancing code generation with tool-integrated agent systems for real-world repo-level coding challenges","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.22844","last_updated":"2025-07-30T17:00:48Z","snapshot_observed_at":"2026-08-07T22:42:41.639384Z","submitted_at":"2025-07-30T17:00:48Z","title":"RLVMR: Reinforcement Learning with Verifiable Meta-Reasoning Rewards for Robust Long-Horizon Agents","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-06T11:21:27.893716Z"},"links":{"citing_paper":"/paper/2507.22844"},"observation_digest":"sha256:104d8a3b6c4788042cd3e5bb4fe5c0d044c7dc7c705b0f2fa10069525f9b71b0","observation_id":"fd3ffdca-1885-46b0-adfc-0d47dec6e9fb","resolution":{"observed_at":"2026-08-06T11:21:27.893716Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:21:29.005304Z","title":"You only look at screens: Multimodal chain-of-action agents","venue":null,"work_id":"29206953-c1e8-47a6-82d6-e4ce2777dec4","year":2024},"citing_paper":{"arxiv_id":"2507.22844","last_updated":"2025-07-30T17:00:48Z","snapshot_observed_at":"2026-08-07T22:42:41.639384Z","submitted_at":"2025-07-30T17:00:48Z","title":"RLVMR: Reinforcement Learning with Verifiable Meta-Reasoning Rewards for Robust Long-Horizon Agents","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-06T11:21:27.988018Z"},"links":{"citing_paper":"/paper/2507.22844"},"observation_digest":"sha256:fed89e7390f54ddd964d754097f4867779c40c4205a7a37f9e91e7c7ecb589b7","observation_id":"b5e28e93-3f2c-446c-bb61-04b4a72ae661","resolution":{"observed_at":"2026-08-06T11:21:29.105836Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:21:28.841358Z","title":"Archer: training language model agents via hierarchical multi-turn rl","venue":null,"work_id":"4c36a344-860e-449d-8098-dbcb429f9326","year":2024},"citing_paper":{"arxiv_id":"2507.22844","last_updated":"2025-07-30T17:00:48Z","snapshot_observed_at":"2026-08-07T22:42:41.639384Z","submitted_at":"2025-07-30T17:00:48Z","title":"RLVMR: Reinforcement Learning with Verifiable Meta-Reasoning Rewards for Robust Long-Horizon Agents","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-06T11:21:28.082695Z"},"links":{"citing_paper":"/paper/2507.22844"},"observation_digest":"sha256:8a19b47335d8238f1189170586f7fed1a7625f141938f9e4f1acedd832b402fe","observation_id":"fab776c0-00c2-49ae-91bc-fa9fe8e225d6","resolution":{"observed_at":"2026-08-06T11:21:28.945122Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:21:28.176007Z","title":"@esa (Ref","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.22844","last_updated":"2025-07-30T17:00:48Z","snapshot_observed_at":"2026-08-07T22:42:41.639384Z","submitted_at":"2025-07-30T17:00:48Z","title":"RLVMR: Reinforcement Learning with Verifiable Meta-Reasoning Rewards for Robust Long-Horizon Agents","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-06T11:21:28.176007Z"},"links":{"citing_paper":"/paper/2507.22844"},"observation_digest":"sha256:428a18b65ebe15786c1899f136f0e6a20bd0d1cfe1dc88a10419bdb5ea269ea3","observation_id":"ffe30d0c-eb40-4678-a19d-6972570fabd9","resolution":{"observed_at":"2026-08-06T11:21:28.176007Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:21:28.285293Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.22844","last_updated":"2025-07-30T17:00:48Z","snapshot_observed_at":"2026-08-07T22:42:41.639384Z","submitted_at":"2025-07-30T17:00:48Z","title":"RLVMR: Reinforcement Learning with Verifiable Meta-Reasoning Rewards for Robust Long-Horizon Agents","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-06T11:21:28.285293Z"},"links":{"citing_paper":"/paper/2507.22844"},"observation_digest":"sha256:6e16777ae0b7aea205d3e6c560d0a8bc446df955eaa0d61cce8c65c254e1f18c","observation_id":"808f4ef1-244a-4aa2-bfc5-0a214225c43a","resolution":{"observed_at":"2026-08-06T11:21:28.285293Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:21:28.707945Z","title":null,"venue":null,"work_id":"3f4b075a-cec3-4448-b3dd-51b51bf76949","year":2024},"citing_paper":{"arxiv_id":"2507.22844","last_updated":"2025-07-30T17:00:48Z","snapshot_observed_at":"2026-08-07T22:42:41.639384Z","submitted_at":"2025-07-30T17:00:48Z","title":"RLVMR: Reinforcement Learning with Verifiable Meta-Reasoning Rewards for Robust Long-Horizon Agents","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-06T11:21:28.356097Z"},"links":{"citing_paper":"/paper/2507.22844"},"observation_digest":"sha256:54c6363a9b864760341b6abd58c85dbba433200331d3a6374bee37ae8ce5a5bd","observation_id":"afe29c0e-0c7f-47c8-9952-218ab84d364d","resolution":{"observed_at":"2026-08-06T11:21:28.775163Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2507.22844","last_updated":"2025-07-30T17:00:48Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-07T22:42:41.639384Z","submitted_at":"2025-07-30T17:00:48Z","title":"RLVMR: Reinforcement Learning with Verifiable Meta-Reasoning Rewards for Robust Long-Horizon Agents"},"reference_resolution":{"displayed":40,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":32,"verified_exact":0,"verified_fuzzy":8},"total_outbound_references":40},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 40 of 40 outbound references and 17 inbound Pith citation observations for arXiv:2507.22844."}