{"as_of":"2026-08-18T01:48:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:bc8a3bdf34d204fe5b07bee28730a32ddf521259e464bc440fc68cffd39021ed","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":51,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":51,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-17T06:30:58.91139+00:00","state":"measured"},{"denominator":51,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":51,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-16T04:43:44.467130Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"arxiv_reference","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":0,"observed_at":"2026-08-05T02:28:24.338817Z","source":"arxiv_reference"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2503.23829","last_updated":"2025-04-01T14:48:02Z","snapshot_observed_at":"2026-08-16T12:45:26.696220Z","submitted_at":"2025-03-31T08:22:49Z","title":"Crossing the Reward Bridge: Expanding RL with Verifiable Rewards Across Diverse Domains","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.23829","snapshot_observed_at":"2026-08-16T04:43:44.467130Z","title":"Crossing the reward bridge: Expanding rl with verifiable rewards across diverse domains, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.00551","last_updated":"2025-05-15T14:16:03Z","snapshot_observed_at":"2026-08-17T18:29:23.516617Z","submitted_at":"2025-05-01T14:28:35Z","title":"100 Days After DeepSeek-R1: A Survey on Replication Studies and More Directions for Reasoning Language Models","version":3},"reference_index":112,"source":"arxiv_source","source_observed_at":"2026-08-16T04:43:44.467130Z"},"links":{"cited_paper":"/paper/2503.23829","citing_paper":"/paper/2505.00551"},"observation_digest":"sha256:4bbd063b97cf6e8d13e36d0e21176203ead725772c38aeaea0108699935bbb39","observation_id":"4bcdf1b4-c21a-4413-bc33-70e03eb18358","resolution":{"observed_at":"2026-08-16T04:43:44.467130Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.23829","last_updated":"2025-04-01T14:48:02Z","snapshot_observed_at":"2026-08-16T12:45:26.696220Z","submitted_at":"2025-03-31T08:22:49Z","title":"Crossing the Reward Bridge: Expanding RL with Verifiable Rewards Across Diverse Domains","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.23829","snapshot_observed_at":"2026-08-15T20:18:14.066640Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.13445","last_updated":"2025-05-19T17:59:31Z","snapshot_observed_at":"2026-08-17T21:57:34.658507Z","submitted_at":"2025-05-19T17:59:31Z","title":"Trust, But Verify: A Self-Verification Approach to Reinforcement Learning with Verifiable Rewards","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-15T20:18:14.066640Z"},"links":{"cited_paper":"/paper/2503.23829","citing_paper":"/paper/2505.13445"},"observation_digest":"sha256:a83d939f961f13be4fdfe2c4317356afac15a46d22266ad05ff819cb569f1797","observation_id":"e14f3f10-e97e-4664-b51d-4925cd83e528","resolution":{"observed_at":"2026-08-15T20:18:14.066640Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.23829","last_updated":"2025-04-01T14:48:02Z","snapshot_observed_at":"2026-08-16T12:45:26.696220Z","submitted_at":"2025-03-31T08:22:49Z","title":"Crossing the Reward Bridge: Expanding RL with Verifiable Rewards Across Diverse Domains","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.23829","snapshot_observed_at":"2026-08-07T15:34:09.276522Z","title":"Crossing the reward bridge: Expanding rl with verifiable rewards across diverse domains, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.14652","last_updated":"2025-06-09T17:40:25Z","snapshot_observed_at":"2026-08-15T19:21:03.230846Z","submitted_at":"2025-05-20T17:41:33Z","title":"General-Reasoner: Advancing LLM Reasoning Across All Domains","version":5},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T15:34:09.276522Z"},"links":{"cited_paper":"/paper/2503.23829","citing_paper":"/paper/2505.14652"},"observation_digest":"sha256:c6c4307a31167cdc2697542661947bf1d0d4e8dade8045016563a51be7e47262","observation_id":"5e84209f-bbff-45ee-a5d2-77e813fae459","resolution":{"observed_at":"2026-08-07T15:34:09.276522Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.23829","last_updated":"2025-04-01T14:48:02Z","snapshot_observed_at":"2026-08-16T12:45:26.696220Z","submitted_at":"2025-03-31T08:22:49Z","title":"Crossing the Reward Bridge: Expanding RL with Verifiable Rewards Across Diverse Domains","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.23829","snapshot_observed_at":"2026-08-07T14:46:17.653974Z","title":"Expanding rl with verifiable rewards across diverse domains.arXiv preprint arXiv:2503.23829, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.17697","last_updated":"2025-05-23T10:07:18Z","snapshot_observed_at":"2026-08-16T10:57:42.507903Z","submitted_at":"2025-05-23T10:07:18Z","title":"Activation Control for Efficiently Eliciting Long Chain-of-thought Ability of Language Models","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T14:46:17.653974Z"},"links":{"cited_paper":"/paper/2503.23829","citing_paper":"/paper/2505.17697"},"observation_digest":"sha256:361213a8f2bc92d0e13c31a01fb4fdc9bab8adca93262abc13a54fc2a9419d4e","observation_id":"73c61492-c207-493b-b743-8d840017c1c7","resolution":{"observed_at":"2026-08-07T14:46:17.653974Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.23829","last_updated":"2025-04-01T14:48:02Z","snapshot_observed_at":"2026-08-16T12:45:26.696220Z","submitted_at":"2025-03-31T08:22:49Z","title":"Crossing the Reward Bridge: Expanding RL with Verifiable Rewards Across Diverse Domains","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.23829","snapshot_observed_at":"2026-08-07T13:35:54.067551Z","title":"Expanding rl with verifiable rewards across diverse domains.arXiv preprint arXiv:2503.23829, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.21493","last_updated":"2025-05-27T17:56:27Z","snapshot_observed_at":"2026-08-13T18:42:34.464744Z","submitted_at":"2025-05-27T17:56:27Z","title":"Reinforcing General Reasoning without Verifiers","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T13:35:54.067551Z"},"links":{"cited_paper":"/paper/2503.23829","citing_paper":"/paper/2505.21493"},"observation_digest":"sha256:536a624ef7a60af29942043a04043d4173eae3de30983c1dc161ad114a4221b9","observation_id":"facf22d4-454e-4613-b858-c10da0a74038","resolution":{"observed_at":"2026-08-07T13:35:54.067551Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.23829","last_updated":"2025-04-01T14:48:02Z","snapshot_observed_at":"2026-08-16T12:45:26.696220Z","submitted_at":"2025-03-31T08:22:49Z","title":"Crossing the Reward Bridge: Expanding RL with Verifiable Rewards Across Diverse Domains","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.23829","snapshot_observed_at":"2026-08-07T13:21:02.793750Z","title":"Expanding rl with verifiable rewards across diverse domains.arXiv preprint arXiv:2503.23829, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.22039","last_updated":"2026-07-29T09:31:57Z","snapshot_observed_at":"2026-08-15T03:09:21.401254Z","submitted_at":"2025-05-28T07:02:15Z","title":"OmniAD: Detect and Understand Industrial Anomaly via Multimodal Reasoning","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T13:21:02.793750Z"},"links":{"cited_paper":"/paper/2503.23829","citing_paper":"/paper/2505.22039"},"observation_digest":"sha256:00ba742985b02ed77484416c2679147d9986eaa612fa3eb0734df278c1f18687","observation_id":"cf464214-97c7-4498-990d-9e23b52bfaea","resolution":{"observed_at":"2026-08-07T13:21:02.793750Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.23829","last_updated":"2025-04-01T14:48:02Z","snapshot_observed_at":"2026-08-16T12:45:26.696220Z","submitted_at":"2025-03-31T08:22:49Z","title":"Crossing the Reward Bridge: Expanding RL with Verifiable Rewards Across Diverse Domains","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.23829","snapshot_observed_at":"2026-08-07T12:40:12.121976Z","title":"Expanding rl with verifiable rewards across diverse domains.arXiv preprint arXiv:2503.23829, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.24105","last_updated":"2025-05-30T01:13:22Z","snapshot_observed_at":"2026-08-09T13:46:57.143129Z","submitted_at":"2025-05-30T01:13:22Z","title":"Training LLMs for EHR-Based Reasoning Tasks via Reinforcement Learning","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T12:40:12.121976Z"},"links":{"cited_paper":"/paper/2503.23829","citing_paper":"/paper/2505.24105"},"observation_digest":"sha256:cbf53dd8130fbfb74d210102e8704b4bc038c3f853c69a17c5aaddd779e7ee42","observation_id":"645593a1-35a9-47e3-9965-95a705d71bbf","resolution":{"observed_at":"2026-08-07T12:40:12.121976Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.23829","last_updated":"2025-04-01T14:48:02Z","snapshot_observed_at":"2026-08-16T12:45:26.696220Z","submitted_at":"2025-03-31T08:22:49Z","title":"Crossing the Reward Bridge: Expanding RL with Verifiable Rewards Across Diverse Domains","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.23829","snapshot_observed_at":"2026-08-07T12:06:28.437391Z","title":"Crossing the reward bridge: Expanding rl with verifiable rewards across diverse domains","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.00577","last_updated":"2025-05-31T14:22:40Z","snapshot_observed_at":"2026-08-14T12:16:12.495445Z","submitted_at":"2025-05-31T14:22:40Z","title":"Reasoning Like an Economist: Post-Training on Economic Problems Induces Strategic Generalization in LLMs","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-07T12:06:28.437391Z"},"links":{"cited_paper":"/paper/2503.23829","citing_paper":"/paper/2506.00577"},"observation_digest":"sha256:75ae9d5bb6ab08e12e62e783c5e1bbae91222c510cf79bfa40ce5b97354b9588","observation_id":"b96aebd1-5915-490a-b807-7b216794f814","resolution":{"observed_at":"2026-08-07T12:06:28.437391Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.23829","last_updated":"2025-04-01T14:48:02Z","snapshot_observed_at":"2026-08-16T12:45:26.696220Z","submitted_at":"2025-03-31T08:22:49Z","title":"Crossing the Reward Bridge: Expanding RL with Verifiable Rewards Across Diverse Domains","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.23829","snapshot_observed_at":"2026-08-07T11:28:35.320702Z","title":"arXiv preprint arXiv:2503.23829 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.02459","last_updated":"2026-06-29T11:06:13Z","snapshot_observed_at":"2026-08-17T13:50:35.422397Z","submitted_at":"2025-06-03T05:22:04Z","title":"ReSpace: Text-Driven Autoregressive 3D Indoor Scene Synthesis and Editing","version":6},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T11:28:35.320702Z"},"links":{"cited_paper":"/paper/2503.23829","citing_paper":"/paper/2506.02459"},"observation_digest":"sha256:e9be530f1ff82b760ebce9b903e0ab4377ded4ca9fd1f7fd4932fa92950f822b","observation_id":"fa4c3211-c002-4827-8936-5f75068aeef6","resolution":{"observed_at":"2026-08-07T11:28:35.320702Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.23829","last_updated":"2025-04-01T14:48:02Z","snapshot_observed_at":"2026-08-16T12:45:26.696220Z","submitted_at":"2025-03-31T08:22:49Z","title":"Crossing the Reward Bridge: Expanding RL with Verifiable Rewards Across Diverse Domains","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.23829","snapshot_observed_at":"2026-08-07T06:02:33.035346Z","title":"Crossing the reward bridge: Expanding rl with verifiable rewards across diverse domains","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.06122","last_updated":"2025-06-06T14:33:56Z","snapshot_observed_at":"2026-08-13T17:30:05.303052Z","submitted_at":"2025-06-06T14:33:56Z","title":"Reinforcement Learning Optimization for Large-Scale Learning: An Efficient and User-Friendly Scaling Library","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-07T06:02:33.035346Z"},"links":{"cited_paper":"/paper/2503.23829","citing_paper":"/paper/2506.06122"},"observation_digest":"sha256:1f9ffdf9bb340f44a47ef1095e6a414994c72785093fb2340e59a72a1958371d","observation_id":"4f20c883-72af-4be5-b670-ffd717f77947","resolution":{"observed_at":"2026-08-07T06:02:33.035346Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.23829","last_updated":"2025-04-01T14:48:02Z","snapshot_observed_at":"2026-08-16T12:45:26.696220Z","submitted_at":"2025-03-31T08:22:49Z","title":"Crossing the Reward Bridge: Expanding RL with Verifiable Rewards Across Diverse Domains","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.23829","snapshot_observed_at":"2026-08-07T05:09:45.062113Z","title":"Cross- ing the reward bridge: Expanding rl with verifiable rewards across diverse domains.arXiv preprint arXiv:2503.23829, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.08745","last_updated":"2025-06-10T12:40:39Z","snapshot_observed_at":"2026-08-12T19:31:07.499130Z","submitted_at":"2025-06-10T12:40:39Z","title":"Consistent Paths Lead to Truth: Self-Rewarding Reinforcement Learning for LLM Reasoning","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T05:09:45.062113Z"},"links":{"cited_paper":"/paper/2503.23829","citing_paper":"/paper/2506.08745"},"observation_digest":"sha256:48ff3edc53dd1f0e51718dc22775e3b010efa1f83bd39c84bf9e5feabcf32509","observation_id":"89f5da95-4b79-4e1e-ba65-f83acba760b6","resolution":{"observed_at":"2026-08-07T05:09:45.062113Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.23829","last_updated":"2025-04-01T14:48:02Z","snapshot_observed_at":"2026-08-16T12:45:26.696220Z","submitted_at":"2025-03-31T08:22:49Z","title":"Crossing the Reward Bridge: Expanding RL with Verifiable Rewards Across Diverse Domains","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.23829","snapshot_observed_at":"2026-08-07T01:03:39.063087Z","title":"Expanding rl with verifiable rewards across diverse domains,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.12217","last_updated":"2025-06-13T20:40:13Z","snapshot_observed_at":"2026-08-13T15:09:57.842743Z","submitted_at":"2025-06-13T20:40:13Z","title":"From Emergence to Control: Probing and Modulating Self-Reflection in Language Models","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T01:03:39.063087Z"},"links":{"cited_paper":"/paper/2503.23829","citing_paper":"/paper/2506.12217"},"observation_digest":"sha256:aebe44de7977246ce6c4d751886ad12322101d44779c120bd05e21cb49a954cb","observation_id":"45d137f3-ca87-4e2f-b01a-e084297c6e34","resolution":{"observed_at":"2026-08-07T01:03:39.063087Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.23829","last_updated":"2025-04-01T14:48:02Z","snapshot_observed_at":"2026-08-16T12:45:26.696220Z","submitted_at":"2025-03-31T08:22:49Z","title":"Crossing the Reward Bridge: Expanding RL with Verifiable Rewards Across Diverse Domains","version":2},"cited_work":{"arxiv_id":"2503.23829","doi":"10.48550/arxiv.2503.23829","metadata_source":"arxiv_reference","pith_arxiv_id":"2503.23829","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Crossing the reward bridge: Expanding RL with verifiable rewards across diverse domains","venue":"ArXiv.org","work_id":"a1dbfba1-b433-4260-abc6-bf28628844b9","year":2025},"citing_paper":{"arxiv_id":"2506.13351","last_updated":"2026-05-07T20:19:13Z","snapshot_observed_at":"2026-08-17T13:08:52.450705Z","submitted_at":"2025-06-16T10:43:38Z","title":"Direct Reasoning Optimization: Token-Level Reasoning Reflectivity Meets Rubric Gates for Unverifiable Tasks","version":3},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-19T09:48:56.990745Z"},"links":{"cited_paper":"/paper/2503.23829","citing_paper":"/paper/2506.13351"},"observation_digest":"sha256:4c4b64007424c57f3e02735db698939890f6e2937fa71d0230d94f7438e6429d","observation_id":"7745fa08-d56a-4cc0-aa9c-f06996f5d17d","resolution":{"observed_at":"2026-05-19T09:52:14.093197Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.23829","last_updated":"2025-04-01T14:48:02Z","snapshot_observed_at":"2026-08-16T12:45:26.696220Z","submitted_at":"2025-03-31T08:22:49Z","title":"Crossing the Reward Bridge: Expanding RL with Verifiable Rewards Across Diverse Domains","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.23829","snapshot_observed_at":"2026-08-06T20:42:28.038550Z","title":"Expanding rl with verifiable rewards across diverse domains","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.02092","last_updated":"2025-07-02T19:17:29Z","snapshot_observed_at":"2026-08-17T19:50:10.817332Z","submitted_at":"2025-07-02T19:17:29Z","title":"Energy-Based Transformers are Scalable Learners and Thinkers","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T20:42:28.038550Z"},"links":{"cited_paper":"/paper/2503.23829","citing_paper":"/paper/2507.02092"},"observation_digest":"sha256:0499e29f4e4be165da060d11f74eca295dcab7462025455230fc008391a362fd","observation_id":"65d37c96-ba03-4096-9c57-857ff75d8237","resolution":{"observed_at":"2026-08-06T20:42:28.038550Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.23829","last_updated":"2025-04-01T14:48:02Z","snapshot_observed_at":"2026-08-16T12:45:26.696220Z","submitted_at":"2025-03-31T08:22:49Z","title":"Crossing the Reward Bridge: Expanding RL with Verifiable Rewards Across Diverse Domains","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.23829","snapshot_observed_at":"2026-08-06T18:15:38.987143Z","title":"Crossing the reward bridge: Expanding rl with verifiable rewards across diverse domains","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.08794","last_updated":"2026-06-11T04:21:36Z","snapshot_observed_at":"2026-08-17T18:32:55.983199Z","submitted_at":"2025-07-11T17:55:22Z","title":"One Token to Fool LLM-as-a-Judge","version":3},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-06T18:15:38.987143Z"},"links":{"cited_paper":"/paper/2503.23829","citing_paper":"/paper/2507.08794"},"observation_digest":"sha256:3256f303061456d8786e191bc1c7d6e928768c40df61d2189adeab939ce207ea","observation_id":"03ff0fa0-99bd-4b98-b2c2-b7454de116c4","resolution":{"observed_at":"2026-08-06T18:15:38.987143Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.23829","last_updated":"2025-04-01T14:48:02Z","snapshot_observed_at":"2026-08-16T12:45:26.696220Z","submitted_at":"2025-03-31T08:22:49Z","title":"Crossing the Reward Bridge: Expanding RL with Verifiable Rewards Across Diverse Domains","version":2},"cited_work":{"arxiv_id":"2503.23829","doi":"10.48550/arxiv.2503.23829","metadata_source":"arxiv_reference","pith_arxiv_id":"2503.23829","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Crossing the reward bridge: Expanding RL with verifiable rewards across diverse domains","venue":"ArXiv.org","work_id":"a1dbfba1-b433-4260-abc6-bf28628844b9","year":2025},"citing_paper":{"arxiv_id":"2507.17746","last_updated":"2025-10-03T01:55:55Z","snapshot_observed_at":"2026-08-12T14:23:22.826603Z","submitted_at":"2025-07-23T17:57:55Z","title":"Rubrics as Rewards: Reinforcement Learning Beyond Verifiable Domains","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-13T06:07:56.678339Z"},"links":{"cited_paper":"/paper/2503.23829","citing_paper":"/paper/2507.17746"},"observation_digest":"sha256:8f7cd736021345dc32b68ffcd0c937c2bdde541c135ef4f70dc7b1e3b8d889e9","observation_id":"0b6983d6-f37e-4f3d-acf4-257c3df171fc","resolution":{"observed_at":"2026-05-13T06:07:56.851371Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.23829","last_updated":"2025-04-01T14:48:02Z","snapshot_observed_at":"2026-08-16T12:45:26.696220Z","submitted_at":"2025-03-31T08:22:49Z","title":"Crossing the Reward Bridge: Expanding RL with Verifiable Rewards Across Diverse Domains","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.23829","snapshot_observed_at":"2026-08-15T17:56:41.062832Z","title":"Crossing the reward bridge: Expanding rl with verifiable rewards across diverse domains","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.20150","last_updated":"2025-07-27T06:56:10Z","snapshot_observed_at":"2026-08-17T07:31:10.615216Z","submitted_at":"2025-07-27T06:56:10Z","title":"The Policy Cliff: A Theoretical Analysis of Reward-Policy Maps in Large Language Models","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-15T17:56:41.062832Z"},"links":{"cited_paper":"/paper/2503.23829","citing_paper":"/paper/2507.20150"},"observation_digest":"sha256:957ddc851ce940ccd109eaffe77875dd707cfcf8154447424dced013d58c45f4","observation_id":"0ae26018-5913-4345-bf2f-319ccf727136","resolution":{"observed_at":"2026-08-15T17:56:41.062832Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.23829","last_updated":"2025-04-01T14:48:02Z","snapshot_observed_at":"2026-08-16T12:45:26.696220Z","submitted_at":"2025-03-31T08:22:49Z","title":"Crossing the Reward Bridge: Expanding RL with Verifiable Rewards Across Diverse Domains","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.23829","snapshot_observed_at":"2026-08-15T16:37:52.916321Z","title":"Expanding rl with verifiable rewards across diverse domains","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.03059","last_updated":"2026-07-26T23:59:38Z","snapshot_observed_at":"2026-08-15T17:21:39.654535Z","submitted_at":"2025-09-03T06:42:40Z","title":"Loong: Synthesize Long Chain-of-Thoughts at Scale through Verifiers","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-15T16:37:52.916321Z"},"links":{"cited_paper":"/paper/2503.23829","citing_paper":"/paper/2509.03059"},"observation_digest":"sha256:b889f195e9167fc6f413dddadf69bf562293529cfb2bdb7f6979b2dcf7c51ea8","observation_id":"7b93d9e6-be98-401e-aee1-b81ff7a36c70","resolution":{"observed_at":"2026-08-15T16:37:52.916321Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.23829","last_updated":"2025-04-01T14:48:02Z","snapshot_observed_at":"2026-08-16T12:45:26.696220Z","submitted_at":"2025-03-31T08:22:49Z","title":"Crossing the Reward Bridge: Expanding RL with Verifiable Rewards Across Diverse Domains","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.23829","snapshot_observed_at":"2026-08-05T05:46:44.417762Z","title":"arXiv:2503.23829 [cs]","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.05394","last_updated":"2025-09-05T11:13:40Z","snapshot_observed_at":"2026-08-15T16:15:42.683527Z","submitted_at":"2025-09-05T11:13:40Z","title":"Reverse Browser: Vector-Image-to-Code Generator","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-05T05:46:44.417762Z"},"links":{"cited_paper":"/paper/2503.23829","citing_paper":"/paper/2509.05394"},"observation_digest":"sha256:2426bbea175b275be2148f58fdda25300ff3e30372584fbb03065ee0ca5cfb2b","observation_id":"459fb54b-206d-4965-8a55-b0e54227814b","resolution":{"observed_at":"2026-08-05T05:46:44.417762Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.23829","last_updated":"2025-04-01T14:48:02Z","snapshot_observed_at":"2026-08-16T12:45:26.696220Z","submitted_at":"2025-03-31T08:22:49Z","title":"Crossing the Reward Bridge: Expanding RL with Verifiable Rewards Across Diverse Domains","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.23829","snapshot_observed_at":"2026-08-04T17:57:52.481344Z","title":"Crossing the reward bridge: Expanding rl with verifiable rewards across diverse domains","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.14257","last_updated":"2026-07-23T12:32:53Z","snapshot_observed_at":"2026-08-13T06:10:20.853148Z","submitted_at":"2025-09-12T15:34:07Z","title":"Student-Centered Distillation Narrows the Agentic Gap Between Small and Large LLMs","version":3},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-04T17:57:52.481344Z"},"links":{"cited_paper":"/paper/2503.23829","citing_paper":"/paper/2509.14257"},"observation_digest":"sha256:e8a6a98cc57461dd23ca8a33424016e5bc9d666d1e6f69847a3d343a3c8a0bf8","observation_id":"500c22dd-a511-42f3-b0b0-879be3b0da6b","resolution":{"observed_at":"2026-08-04T17:57:52.481344Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.23829","last_updated":"2025-04-01T14:48:02Z","snapshot_observed_at":"2026-08-16T12:45:26.696220Z","submitted_at":"2025-03-31T08:22:49Z","title":"Crossing the Reward Bridge: Expanding RL with Verifiable Rewards Across Diverse Domains","version":2},"cited_work":{"arxiv_id":"2503.23829","doi":"10.48550/arxiv.2503.23829","metadata_source":"arxiv_reference","pith_arxiv_id":"2503.23829","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Crossing the reward bridge: Expanding RL with verifiable rewards across diverse domains","venue":"ArXiv.org","work_id":"a1dbfba1-b433-4260-abc6-bf28628844b9","year":2025},"citing_paper":{"arxiv_id":"2509.25454","last_updated":"2026-04-06T19:16:24Z","snapshot_observed_at":"2026-08-14T01:37:27.619893Z","submitted_at":"2025-09-29T20:00:29Z","title":"DeepSearch: Overcome the Bottleneck of Reinforcement Learning with Verifiable Rewards via Monte Carlo Tree Search","version":4},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-18T12:12:25.437344Z"},"links":{"cited_paper":"/paper/2503.23829","citing_paper":"/paper/2509.25454"},"observation_digest":"sha256:b8286f3aaa442ff090a53225db3bb0201d22f89b1b588e840f7434e3c1bf6ce9","observation_id":"21974947-640f-41f2-956a-4a4e42720073","resolution":{"observed_at":"2026-05-18T12:12:35.834905Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.23829","last_updated":"2025-04-01T14:48:02Z","snapshot_observed_at":"2026-08-16T12:45:26.696220Z","submitted_at":"2025-03-31T08:22:49Z","title":"Crossing the Reward Bridge: Expanding RL with Verifiable Rewards Across Diverse Domains","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.23829","snapshot_observed_at":"2026-08-04T10:40:48.485814Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.09278","last_updated":"2026-06-28T16:27:56Z","snapshot_observed_at":"2026-08-17T20:34:52.934822Z","submitted_at":"2025-10-10T11:21:09Z","title":"CLARity: Reasoning Consistency Alone Can Teach Reinforced Experts","version":2},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-04T10:40:48.485814Z"},"links":{"cited_paper":"/paper/2503.23829","citing_paper":"/paper/2510.09278"},"observation_digest":"sha256:a0a11a7a4db2941178763d37800eaccfa430e09ffc6503b85edb4377cee4383e","observation_id":"5678ad83-14b1-4b82-b552-9a4d16097830","resolution":{"observed_at":"2026-08-04T10:40:48.485814Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.23829","last_updated":"2025-04-01T14:48:02Z","snapshot_observed_at":"2026-08-16T12:45:26.696220Z","submitted_at":"2025-03-31T08:22:49Z","title":"Crossing the Reward Bridge: Expanding RL with Verifiable Rewards Across Diverse Domains","version":2},"cited_work":{"arxiv_id":"2503.23829","doi":"10.48550/arxiv.2503.23829","metadata_source":"arxiv_reference","pith_arxiv_id":"2503.23829","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Crossing the reward bridge: Expanding RL with verifiable rewards across diverse domains","venue":"ArXiv.org","work_id":"a1dbfba1-b433-4260-abc6-bf28628844b9","year":2025},"citing_paper":{"arxiv_id":"2510.10649","last_updated":"2026-04-16T14:51:36Z","snapshot_observed_at":"2026-08-12T17:08:23.428596Z","submitted_at":"2025-10-12T15:06:53Z","title":"Unlocking Exploration in RLVR: Uncertainty-aware Advantage Shaping for Deeper Reasoning","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-18T07:20:01.505216Z"},"links":{"cited_paper":"/paper/2503.23829","citing_paper":"/paper/2510.10649"},"observation_digest":"sha256:70a769ff670398b540969ed5a1aeec5a875ed3d0419d859f83ce18f93d934f7e","observation_id":"f6d6e0de-6812-4916-84ef-98aeff15b891","resolution":{"observed_at":"2026-05-18T07:21:04.360338Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.23829","last_updated":"2025-04-01T14:48:02Z","snapshot_observed_at":"2026-08-16T12:45:26.696220Z","submitted_at":"2025-03-31T08:22:49Z","title":"Crossing the Reward Bridge: Expanding RL with Verifiable Rewards Across Diverse Domains","version":2},"cited_work":{"arxiv_id":"2503.23829","doi":"10.48550/arxiv.2503.23829","metadata_source":"arxiv_reference","pith_arxiv_id":"2503.23829","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Crossing the reward bridge: Expanding RL with verifiable rewards across diverse domains","venue":"ArXiv.org","work_id":"a1dbfba1-b433-4260-abc6-bf28628844b9","year":2025},"citing_paper":{"arxiv_id":"2512.03847","last_updated":"2026-05-06T14:15:19Z","snapshot_observed_at":"2026-08-16T02:48:57.063506Z","submitted_at":"2025-12-03T14:48:38Z","title":"DVPO: Distributional Value Modeling-based Policy Optimization for LLM Post-Training","version":3},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-17T01:46:21.744857Z"},"links":{"cited_paper":"/paper/2503.23829","citing_paper":"/paper/2512.03847"},"observation_digest":"sha256:e07b5be0289c49e3b7bac3aefe14253f318009baf23db5bf946dbfd34cd8be86","observation_id":"49959a33-24e4-4b0d-861a-15ade233c683","resolution":{"observed_at":"2026-05-17T01:48:50.980608Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.23829","last_updated":"2025-04-01T14:48:02Z","snapshot_observed_at":"2026-08-16T12:45:26.696220Z","submitted_at":"2025-03-31T08:22:49Z","title":"Crossing the Reward Bridge: Expanding RL with Verifiable Rewards Across Diverse Domains","version":2},"cited_work":{"arxiv_id":"2503.23829","doi":"10.48550/arxiv.2503.23829","metadata_source":"arxiv_reference","pith_arxiv_id":"2503.23829","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Crossing the reward bridge: Expanding RL with verifiable rewards across diverse domains","venue":"ArXiv.org","work_id":"a1dbfba1-b433-4260-abc6-bf28628844b9","year":2025},"citing_paper":{"arxiv_id":"2601.13262","last_updated":"2026-04-26T01:38:11Z","snapshot_observed_at":"2026-08-11T09:32:38.343501Z","submitted_at":"2026-01-19T17:51:00Z","title":"CURE-Med: Curriculum-Informed Reinforcement Learning for Multilingual Medical Reasoning","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-05-16T13:20:49.919833Z"},"links":{"cited_paper":"/paper/2503.23829","citing_paper":"/paper/2601.13262"},"observation_digest":"sha256:1242f91ae37687500037a3bcc57b93172283d33d80b5e652580693e4580e5c95","observation_id":"553adc0d-e76a-4293-a47a-83b6d66855ed","resolution":{"observed_at":"2026-05-16T13:20:57.559827Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.23829","last_updated":"2025-04-01T14:48:02Z","snapshot_observed_at":"2026-08-16T12:45:26.696220Z","submitted_at":"2025-03-31T08:22:49Z","title":"Crossing the Reward Bridge: Expanding RL with Verifiable Rewards Across Diverse Domains","version":2},"cited_work":{"arxiv_id":"2503.23829","doi":"10.48550/arxiv.2503.23829","metadata_source":"arxiv_reference","pith_arxiv_id":"2503.23829","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Crossing the reward bridge: Expanding RL with verifiable rewards across diverse domains","venue":"ArXiv.org","work_id":"a1dbfba1-b433-4260-abc6-bf28628844b9","year":2025},"citing_paper":{"arxiv_id":"2603.03197","last_updated":"2026-04-12T16:48:44Z","snapshot_observed_at":"2026-08-16T09:32:38.833172Z","submitted_at":"2026-03-03T17:52:39Z","title":"Specificity-aware reinforcement learning for fine-grained open-world classification","version":3},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-05-15T16:44:47.866126Z"},"links":{"cited_paper":"/paper/2503.23829","citing_paper":"/paper/2603.03197"},"observation_digest":"sha256:f68f5f802f69129a061b1b6d6874a33fb253506c36c921aa5cbda6d8c9dfabfd","observation_id":"53947a8e-5330-48d8-88c6-f47d8edd3061","resolution":{"observed_at":"2026-05-15T16:46:17.815819Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.23829","last_updated":"2025-04-01T14:48:02Z","snapshot_observed_at":"2026-08-16T12:45:26.696220Z","submitted_at":"2025-03-31T08:22:49Z","title":"Crossing the Reward Bridge: Expanding RL with Verifiable Rewards Across Diverse Domains","version":2},"cited_work":{"arxiv_id":"2503.23829","doi":"10.48550/arxiv.2503.23829","metadata_source":"arxiv_reference","pith_arxiv_id":"2503.23829","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Crossing the reward bridge: Expanding RL with verifiable rewards across diverse domains","venue":"ArXiv.org","work_id":"a1dbfba1-b433-4260-abc6-bf28628844b9","year":2025},"citing_paper":{"arxiv_id":"2603.16876","last_updated":"2026-05-08T08:14:14Z","snapshot_observed_at":"2026-08-11T14:33:13.282584Z","submitted_at":"2026-02-17T12:48:32Z","title":"Multi-Modal Multi-Agent Reinforcement Learning for Radiology Report Generation","version":2},"reference_index":106,"source":"pdf_text","source_observed_at":"2026-05-15T21:51:10.972744Z"},"links":{"cited_paper":"/paper/2503.23829","citing_paper":"/paper/2603.16876"},"observation_digest":"sha256:728df2ef8b634d1b2e704d7a06b7fe6f57f528c32306f37c36bfc48890316ac8","observation_id":"1570ade8-c9af-4dc6-bf9f-63b133f018d8","resolution":{"observed_at":"2026-05-15T21:51:40.644170Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.23829","last_updated":"2025-04-01T14:48:02Z","snapshot_observed_at":"2026-08-16T12:45:26.696220Z","submitted_at":"2025-03-31T08:22:49Z","title":"Crossing the Reward Bridge: Expanding RL with Verifiable Rewards Across Diverse Domains","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.23829","snapshot_observed_at":"2026-07-13T20:08:17.066898Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.22744","last_updated":"2026-05-29T00:35:02Z","snapshot_observed_at":"2026-08-15T20:22:19.203354Z","submitted_at":"2026-03-24T03:16:32Z","title":"LH-Bench: Skill-Grounded Evaluation of Long-Horizon Agents on Subjective Enterprise Tasks","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-07-13T20:08:17.066898Z"},"links":{"cited_paper":"/paper/2503.23829","citing_paper":"/paper/2603.22744"},"observation_digest":"sha256:f6e71959a614d2e3abc4ec5b4acf16fc01a0a63607b8119c53234299713af009","observation_id":"3b7189d9-5807-4d9e-aa2f-658142edfee5","resolution":{"observed_at":"2026-07-13T20:08:17.066898Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.23829","last_updated":"2025-04-01T14:48:02Z","snapshot_observed_at":"2026-08-16T12:45:26.696220Z","submitted_at":"2025-03-31T08:22:49Z","title":"Crossing the Reward Bridge: Expanding RL with Verifiable Rewards Across Diverse Domains","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.23829","snapshot_observed_at":"2026-07-13T14:23:49.346727Z","title":"Crossing the reward bridge: Expanding rl with verifiable rewards across diverse domains","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2604.01475","last_updated":"2026-06-08T13:23:37Z","snapshot_observed_at":"2026-08-16T04:08:00.222106Z","submitted_at":"2026-04-01T23:31:38Z","title":"Interpretable Electrophysiological Features of Resting-State EEG Capture Cortical Network Dynamics in Parkinsons Disease","version":3},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-07-13T14:23:49.346727Z"},"links":{"cited_paper":"/paper/2503.23829","citing_paper":"/paper/2604.01475"},"observation_digest":"sha256:7a40ecc3b8f183f97f4aa7e622590aa116cf68b8539ab17bad64b31314c441cc","observation_id":"a62ac229-1b51-47de-b77c-2b9ccaf8fd5b","resolution":{"observed_at":"2026-07-13T14:23:49.346727Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.23829","last_updated":"2025-04-01T14:48:02Z","snapshot_observed_at":"2026-08-16T12:45:26.696220Z","submitted_at":"2025-03-31T08:22:49Z","title":"Crossing the Reward Bridge: Expanding RL with Verifiable Rewards Across Diverse Domains","version":2},"cited_work":{"arxiv_id":"2503.23829","doi":"10.48550/arxiv.2503.23829","metadata_source":"arxiv_reference","pith_arxiv_id":"2503.23829","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Crossing the reward bridge: Expanding RL with verifiable rewards across diverse domains","venue":"ArXiv.org","work_id":"a1dbfba1-b433-4260-abc6-bf28628844b9","year":2025},"citing_paper":{"arxiv_id":"2604.10110","last_updated":"2026-04-11T09:08:27Z","snapshot_observed_at":"2026-08-13T14:52:06.768478Z","submitted_at":"2026-04-11T09:08:27Z","title":"Trust Your Memory: Verifiable Control of Smart Homes through Reinforcement Learning with Multi-dimensional Rewards","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-10T16:49:00.343580Z"},"links":{"cited_paper":"/paper/2503.23829","citing_paper":"/paper/2604.10110"},"observation_digest":"sha256:189fbee5d597cb9b9b7492c0cb668be25450849b18f18de4d6d2d7d23a24a4c7","observation_id":"cbb70e96-f794-4e69-a379-9ec69c09355e","resolution":{"observed_at":"2026-05-11T08:06:01.172294Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.23829","last_updated":"2025-04-01T14:48:02Z","snapshot_observed_at":"2026-08-16T12:45:26.696220Z","submitted_at":"2025-03-31T08:22:49Z","title":"Crossing the Reward Bridge: Expanding RL with Verifiable Rewards Across Diverse Domains","version":2},"cited_work":{"arxiv_id":"2503.23829","doi":"10.48550/arxiv.2503.23829","metadata_source":"arxiv_reference","pith_arxiv_id":"2503.23829","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Crossing the reward bridge: Expanding RL with verifiable rewards across diverse domains","venue":"ArXiv.org","work_id":"a1dbfba1-b433-4260-abc6-bf28628844b9","year":2025},"citing_paper":{"arxiv_id":"2604.20755","last_updated":"2026-04-22T16:44:33Z","snapshot_observed_at":"2026-08-12T17:11:51.959264Z","submitted_at":"2026-04-22T16:44:33Z","title":"V-tableR1: Process-Supervised Multimodal Table Reasoning with Critic-Guided Policy Optimization","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-09T23:48:32.613988Z"},"links":{"cited_paper":"/paper/2503.23829","citing_paper":"/paper/2604.20755"},"observation_digest":"sha256:ab1f4af9c9fd541c761645c2d870d55b3c1481064dfa7ee47334be1ebc0f42f3","observation_id":"369ad831-a096-4da0-8abc-13cba5e99796","resolution":{"observed_at":"2026-05-11T14:01:04.148354Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.23829","last_updated":"2025-04-01T14:48:02Z","snapshot_observed_at":"2026-08-16T12:45:26.696220Z","submitted_at":"2025-03-31T08:22:49Z","title":"Crossing the Reward Bridge: Expanding RL with Verifiable Rewards Across Diverse Domains","version":2},"cited_work":{"arxiv_id":"2503.23829","doi":"10.48550/arxiv.2503.23829","metadata_source":"arxiv_reference","pith_arxiv_id":"2503.23829","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Crossing the reward bridge: Expanding RL with verifiable rewards across diverse domains","venue":"ArXiv.org","work_id":"a1dbfba1-b433-4260-abc6-bf28628844b9","year":2025},"citing_paper":{"arxiv_id":"2605.00754","last_updated":"2026-08-09T12:13:50Z","snapshot_observed_at":"2026-08-15T06:04:20.607560Z","submitted_at":"2026-05-01T16:07:34Z","title":"Themis: Training Robust Multilingual Code Reward Models for Flexible Multi-Criteria Scoring","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-09T19:33:35.690030Z"},"links":{"cited_paper":"/paper/2503.23829","citing_paper":"/paper/2605.00754"},"observation_digest":"sha256:7a14918d6e2f72e25f0e8e11adb1772b6fc91520dbc1e2de02d3042767ac2e22","observation_id":"5803ac88-fbb8-4ee0-bba0-c31b7b85402d","resolution":{"observed_at":"2026-05-09T19:35:39.078929Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.23829","last_updated":"2025-04-01T14:48:02Z","snapshot_observed_at":"2026-08-16T12:45:26.696220Z","submitted_at":"2025-03-31T08:22:49Z","title":"Crossing the Reward Bridge: Expanding RL with Verifiable Rewards Across Diverse Domains","version":2},"cited_work":{"arxiv_id":"2503.23829","doi":"10.48550/arxiv.2503.23829","metadata_source":"arxiv_reference","pith_arxiv_id":"2503.23829","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Crossing the reward bridge: Expanding RL with verifiable rewards across diverse domains","venue":"ArXiv.org","work_id":"a1dbfba1-b433-4260-abc6-bf28628844b9","year":2025},"citing_paper":{"arxiv_id":"2605.00754","last_updated":"2026-08-09T12:13:50Z","snapshot_observed_at":"2026-08-15T06:04:20.607560Z","submitted_at":"2026-05-01T16:07:34Z","title":"Themis: Training Robust Multilingual Code Reward Models for Flexible Multi-Criteria Scoring","version":3},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-11T01:56:43.707252Z"},"links":{"cited_paper":"/paper/2503.23829","citing_paper":"/paper/2605.00754"},"observation_digest":"sha256:305f256da1085fe59c9702f40c14cfddaec1809085926de11431e3a3dcdd138a","observation_id":"b3786b5d-2427-4e79-8e10-970e17cfd6c1","resolution":{"observed_at":"2026-05-11T02:15:52.434975Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.23829","last_updated":"2025-04-01T14:48:02Z","snapshot_observed_at":"2026-08-16T12:45:26.696220Z","submitted_at":"2025-03-31T08:22:49Z","title":"Crossing the Reward Bridge: Expanding RL with Verifiable Rewards Across Diverse Domains","version":2},"cited_work":{"arxiv_id":"2503.23829","doi":"10.48550/arxiv.2503.23829","metadata_source":"arxiv_reference","pith_arxiv_id":"2503.23829","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Crossing the reward bridge: Expanding RL with verifiable rewards across diverse domains","venue":"ArXiv.org","work_id":"a1dbfba1-b433-4260-abc6-bf28628844b9","year":2025},"citing_paper":{"arxiv_id":"2605.02913","last_updated":"2026-04-08T00:53:29Z","snapshot_observed_at":"2026-08-13T10:36:16.468710Z","submitted_at":"2026-04-08T00:53:29Z","title":"Generate, Filter, Control, Replay: A Comprehensive Survey of Rollout Strategies for LLM Reinforcement Learning","version":1},"reference_index":105,"source":"arxiv_source","source_observed_at":"2026-05-10T19:15:27.406778Z"},"links":{"cited_paper":"/paper/2503.23829","citing_paper":"/paper/2605.02913"},"observation_digest":"sha256:1b27f46e59053217e3f5a82fdd9b5e3b7dd31b08dc0b91a0273a67d036839490","observation_id":"1dd83977-cef3-48d3-8789-8ceb9697ab7a","resolution":{"observed_at":"2026-05-10T23:15:49.250698Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.23829","last_updated":"2025-04-01T14:48:02Z","snapshot_observed_at":"2026-08-16T12:45:26.696220Z","submitted_at":"2025-03-31T08:22:49Z","title":"Crossing the Reward Bridge: Expanding RL with Verifiable Rewards Across Diverse Domains","version":2},"cited_work":{"arxiv_id":"2503.23829","doi":"10.48550/arxiv.2503.23829","metadata_source":"arxiv_reference","pith_arxiv_id":"2503.23829","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Crossing the reward bridge: Expanding RL with verifiable rewards across diverse domains","venue":"ArXiv.org","work_id":"a1dbfba1-b433-4260-abc6-bf28628844b9","year":2025},"citing_paper":{"arxiv_id":"2605.09879","last_updated":"2026-05-11T02:05:30Z","snapshot_observed_at":"2026-08-11T16:24:33.150151Z","submitted_at":"2026-05-11T02:05:30Z","title":"M2A: Synergizing Mathematical and Agentic Reasoning in Large Language Models","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-12T04:43:50.384980Z"},"links":{"cited_paper":"/paper/2503.23829","citing_paper":"/paper/2605.09879"},"observation_digest":"sha256:0d60ad9983db8f6924c365c6b9f9dd199bffa97fdf5f1d82de681df427da0746","observation_id":"6e20c37c-f7c7-41eb-ab24-00109f9543f2","resolution":{"observed_at":"2026-05-12T06:01:22.662442Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.23829","last_updated":"2025-04-01T14:48:02Z","snapshot_observed_at":"2026-08-16T12:45:26.696220Z","submitted_at":"2025-03-31T08:22:49Z","title":"Crossing the Reward Bridge: Expanding RL with Verifiable Rewards Across Diverse Domains","version":2},"cited_work":{"arxiv_id":"2503.23829","doi":"10.48550/arxiv.2503.23829","metadata_source":"arxiv_reference","pith_arxiv_id":"2503.23829","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Crossing the reward bridge: Expanding RL with verifiable rewards across diverse domains","venue":"ArXiv.org","work_id":"a1dbfba1-b433-4260-abc6-bf28628844b9","year":2025},"citing_paper":{"arxiv_id":"2605.20061","last_updated":"2026-05-19T16:19:29Z","snapshot_observed_at":"2026-08-16T18:43:12.340717Z","submitted_at":"2026-05-19T16:19:29Z","title":"Rewarding Beliefs, Not Actions: Consistency-Guided Credit Assignment for Long-Horizon Agents","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-20T05:35:45.084011Z"},"links":{"cited_paper":"/paper/2503.23829","citing_paper":"/paper/2605.20061"},"observation_digest":"sha256:b2469f45bb9dcedfc1cbf6f07b4a32c4a8070c724748a35274ff4a2b8c44ab44","observation_id":"c2ca204c-6241-40e0-afc0-1f11f80191cb","resolution":{"observed_at":"2026-05-20T05:38:05.525894Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.23829","last_updated":"2025-04-01T14:48:02Z","snapshot_observed_at":"2026-08-16T12:45:26.696220Z","submitted_at":"2025-03-31T08:22:49Z","title":"Crossing the Reward Bridge: Expanding RL with Verifiable Rewards Across Diverse Domains","version":2},"cited_work":{"arxiv_id":"2503.23829","doi":"10.48550/arxiv.2503.23829","metadata_source":"arxiv_reference","pith_arxiv_id":"2503.23829","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Crossing the reward bridge: Expanding RL with verifiable rewards across diverse domains","venue":"ArXiv.org","work_id":"a1dbfba1-b433-4260-abc6-bf28628844b9","year":2025},"citing_paper":{"arxiv_id":"2605.31058","last_updated":"2026-05-29T09:29:32Z","snapshot_observed_at":"2026-08-16T10:02:12.260939Z","submitted_at":"2026-05-29T09:29:32Z","title":"Combinatorial Synthesis: Scaling Code RLVR via Atomic Decomposition and Recombination","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-06-28T23:08:05.597810Z"},"links":{"cited_paper":"/paper/2503.23829","citing_paper":"/paper/2605.31058"},"observation_digest":"sha256:e3ebb8223b8abb7793a5bac49475fe5dc1186e8b877f4fb8228d68620780ffa2","observation_id":"1f31b556-3816-4be0-bc71-8924d6b7bc72","resolution":{"observed_at":"2026-06-28T23:12:47.109855Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.23829","last_updated":"2025-04-01T14:48:02Z","snapshot_observed_at":"2026-08-16T12:45:26.696220Z","submitted_at":"2025-03-31T08:22:49Z","title":"Crossing the Reward Bridge: Expanding RL with Verifiable Rewards Across Diverse Domains","version":2},"cited_work":{"arxiv_id":"2503.23829","doi":"10.48550/arxiv.2503.23829","metadata_source":"arxiv_reference","pith_arxiv_id":"2503.23829","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Crossing the reward bridge: Expanding RL with verifiable rewards across diverse domains","venue":"ArXiv.org","work_id":"a1dbfba1-b433-4260-abc6-bf28628844b9","year":2025},"citing_paper":{"arxiv_id":"2606.00172","last_updated":"2026-05-29T13:21:30Z","snapshot_observed_at":"2026-08-15T08:47:28.179911Z","submitted_at":"2026-05-29T13:21:30Z","title":"CAST: Non-Privileged Clipped Asymmetric Self-Teaching with Advantage Flipping for GRPO","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-06-28T22:25:04.067339Z"},"links":{"cited_paper":"/paper/2503.23829","citing_paper":"/paper/2606.00172"},"observation_digest":"sha256:61bc49631bbab44bed8b89428f4ac9d5bbc3d7c929c28c06904a41a01b06154b","observation_id":"bfe80b35-bcae-4429-a91f-e2caf0a75a60","resolution":{"observed_at":"2026-07-01T19:26:01.064488Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.23829","last_updated":"2025-04-01T14:48:02Z","snapshot_observed_at":"2026-08-16T12:45:26.696220Z","submitted_at":"2025-03-31T08:22:49Z","title":"Crossing the Reward Bridge: Expanding RL with Verifiable Rewards Across Diverse Domains","version":2},"cited_work":{"arxiv_id":"2503.23829","doi":"10.48550/arxiv.2503.23829","metadata_source":"arxiv_reference","pith_arxiv_id":"2503.23829","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Crossing the reward bridge: Expanding RL with verifiable rewards across diverse domains","venue":"ArXiv.org","work_id":"a1dbfba1-b433-4260-abc6-bf28628844b9","year":2025},"citing_paper":{"arxiv_id":"2606.00609","last_updated":"2026-05-30T08:18:40Z","snapshot_observed_at":"2026-08-12T22:34:53.432641Z","submitted_at":"2026-05-30T08:18:40Z","title":"CARE-RL: Capability-Aware Reinforcement Learning for Mitigating Cross-Domain Conflicts","version":1},"reference_index":70,"source":"arxiv_source","source_observed_at":"2026-06-28T19:01:14.340754Z"},"links":{"cited_paper":"/paper/2503.23829","citing_paper":"/paper/2606.00609"},"observation_digest":"sha256:a6a1cd5b9ad9711dd8db219f67d67c76d1fc4e8aa89186bdf956fe7a29246df4","observation_id":"f305aa37-c9eb-46a2-9aa9-e80b02291d7d","resolution":{"observed_at":"2026-06-28T19:02:33.947566Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.23829","last_updated":"2025-04-01T14:48:02Z","snapshot_observed_at":"2026-08-16T12:45:26.696220Z","submitted_at":"2025-03-31T08:22:49Z","title":"Crossing the Reward Bridge: Expanding RL with Verifiable Rewards Across Diverse Domains","version":2},"cited_work":{"arxiv_id":"2503.23829","doi":"10.48550/arxiv.2503.23829","metadata_source":"arxiv_reference","pith_arxiv_id":"2503.23829","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Crossing the reward bridge: Expanding RL with verifiable rewards across diverse domains","venue":"ArXiv.org","work_id":"a1dbfba1-b433-4260-abc6-bf28628844b9","year":2025},"citing_paper":{"arxiv_id":"2606.04516","last_updated":"2026-06-03T06:47:50Z","snapshot_observed_at":"2026-07-06T23:44:37.797802Z","submitted_at":"2026-06-03T06:47:50Z","title":"GeoMin: Data-Efficient Semi-Supervised RLVR via Geometric Distribution Modeling","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-06-28T07:45:43.320339Z"},"links":{"cited_paper":"/paper/2503.23829","citing_paper":"/paper/2606.04516"},"observation_digest":"sha256:9661fa6e6fe4e371480e25ec7b99e4b98278fc7f62c20ed7ae0406f4b61a8149","observation_id":"0569465f-718a-4fb8-91cd-7afc15e533d5","resolution":{"observed_at":"2026-07-02T06:06:40.787545Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.23829","last_updated":"2025-04-01T14:48:02Z","snapshot_observed_at":"2026-08-16T12:45:26.696220Z","submitted_at":"2025-03-31T08:22:49Z","title":"Crossing the Reward Bridge: Expanding RL with Verifiable Rewards Across Diverse Domains","version":2},"cited_work":{"arxiv_id":"2503.23829","doi":"10.48550/arxiv.2503.23829","metadata_source":"arxiv_reference","pith_arxiv_id":"2503.23829","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Crossing the reward bridge: Expanding RL with verifiable rewards across diverse domains","venue":"ArXiv.org","work_id":"a1dbfba1-b433-4260-abc6-bf28628844b9","year":2025},"citing_paper":{"arxiv_id":"2606.09393","last_updated":"2026-06-08T12:09:20Z","snapshot_observed_at":"2026-08-07T21:51:25.793927Z","submitted_at":"2026-06-08T12:09:20Z","title":"CapRL++: Unified Reinforcement Learning with Verifiable Rewards for Dense Image and Video Captioning","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-06-27T17:21:38.543724Z"},"links":{"cited_paper":"/paper/2503.23829","citing_paper":"/paper/2606.09393"},"observation_digest":"sha256:1a36ce1f5411cedbc04bcda12f68e5cd533704bb76f1abfca8273cd89338e87e","observation_id":"69cbd603-7104-40b4-853a-246a243078a3","resolution":{"observed_at":"2026-07-03T00:17:29.019297Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.23829","last_updated":"2025-04-01T14:48:02Z","snapshot_observed_at":"2026-08-16T12:45:26.696220Z","submitted_at":"2025-03-31T08:22:49Z","title":"Crossing the Reward Bridge: Expanding RL with Verifiable Rewards Across Diverse Domains","version":2},"cited_work":{"arxiv_id":"2503.23829","doi":"10.48550/arxiv.2503.23829","metadata_source":"arxiv_reference","pith_arxiv_id":"2503.23829","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Crossing the reward bridge: Expanding RL with verifiable rewards across diverse domains","venue":"ArXiv.org","work_id":"a1dbfba1-b433-4260-abc6-bf28628844b9","year":2025},"citing_paper":{"arxiv_id":"2606.23557","last_updated":"2026-06-22T16:28:11Z","snapshot_observed_at":"2026-08-13T21:10:59.170997Z","submitted_at":"2026-06-22T16:28:11Z","title":"Dense Reward for Multi-View 3D Reasoning with Global Maps and Local Views","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-06-26T08:38:46.044079Z"},"links":{"cited_paper":"/paper/2503.23829","citing_paper":"/paper/2606.23557"},"observation_digest":"sha256:beec6d4c477b4d55402b9d9a44d8dadef311f11b8cbdcb41a19dd1e007e46f67","observation_id":"55788ff5-3d72-4a1a-888c-f2014b89a2f6","resolution":{"observed_at":"2026-07-04T10:39:45.338242Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.23829","last_updated":"2025-04-01T14:48:02Z","snapshot_observed_at":"2026-08-16T12:45:26.696220Z","submitted_at":"2025-03-31T08:22:49Z","title":"Crossing the Reward Bridge: Expanding RL with Verifiable Rewards Across Diverse Domains","version":2},"cited_work":{"arxiv_id":"2503.23829","doi":"10.48550/arxiv.2503.23829","metadata_source":"arxiv_reference","pith_arxiv_id":"2503.23829","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Crossing the reward bridge: Expanding RL with verifiable rewards across diverse domains","venue":"ArXiv.org","work_id":"a1dbfba1-b433-4260-abc6-bf28628844b9","year":2025},"citing_paper":{"arxiv_id":"2606.24539","last_updated":"2026-06-23T13:06:51Z","snapshot_observed_at":"2026-08-02T12:19:25.025255Z","submitted_at":"2026-06-23T13:06:51Z","title":"PointVG-R: Internalizing Geometric Reasoning in MLLMs for Precise Pointing Localization via Visual Chain of Thought","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-06-26T00:46:17.094339Z"},"links":{"cited_paper":"/paper/2503.23829","citing_paper":"/paper/2606.24539"},"observation_digest":"sha256:d5840116a9334c41c756309d6f81c1f1f55962ae54c3296626c7925bcdf9a23f","observation_id":"1bb171b7-5dd2-4e15-b5ba-78bbaeb0644f","resolution":{"observed_at":"2026-07-04T16:19:57.794350Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.23829","last_updated":"2025-04-01T14:48:02Z","snapshot_observed_at":"2026-08-16T12:45:26.696220Z","submitted_at":"2025-03-31T08:22:49Z","title":"Crossing the Reward Bridge: Expanding RL with Verifiable Rewards Across Diverse Domains","version":2},"cited_work":{"arxiv_id":"2503.23829","doi":"10.48550/arxiv.2503.23829","metadata_source":"arxiv_reference","pith_arxiv_id":"2503.23829","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Crossing the reward bridge: Expanding RL with verifiable rewards across diverse domains","venue":"ArXiv.org","work_id":"a1dbfba1-b433-4260-abc6-bf28628844b9","year":2025},"citing_paper":{"arxiv_id":"2606.28707","last_updated":"2026-06-27T03:25:53Z","snapshot_observed_at":"2026-08-16T01:37:20.494934Z","submitted_at":"2026-06-27T03:25:53Z","title":"BV-Blend: Uncertainty-Weighted Historical Baselines for Stable Critic-Free RL with Verifiable Rewards","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-06-30T10:07:39.554999Z"},"links":{"cited_paper":"/paper/2503.23829","citing_paper":"/paper/2606.28707"},"observation_digest":"sha256:3c5ff8cbc63d35e6aae7066c9743d0c1c4e7976998def87423ac878d2f2b3a80","observation_id":"dcf008c4-a9b1-4f38-9e35-7bf8114e9a0c","resolution":{"observed_at":"2026-06-30T12:44:40.146628Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.23829","last_updated":"2025-04-01T14:48:02Z","snapshot_observed_at":"2026-08-16T12:45:26.696220Z","submitted_at":"2025-03-31T08:22:49Z","title":"Crossing the Reward Bridge: Expanding RL with Verifiable Rewards Across Diverse Domains","version":2},"cited_work":{"arxiv_id":"2503.23829","doi":"10.48550/arxiv.2503.23829","metadata_source":"arxiv_reference","pith_arxiv_id":"2503.23829","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Crossing the reward bridge: Expanding RL with verifiable rewards across diverse domains","venue":"ArXiv.org","work_id":"a1dbfba1-b433-4260-abc6-bf28628844b9","year":2025},"citing_paper":{"arxiv_id":"2607.00139","last_updated":"2026-06-30T20:18:32Z","snapshot_observed_at":"2026-08-07T11:30:39.668036Z","submitted_at":"2026-06-30T20:18:32Z","title":"Benchmarking Frontier LLMs on Arabic Cultural and Sociolinguistic Knowledge: A Cross-Evaluation Framework with Human SME Ground Truth","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-07-02T19:26:21.833145Z"},"links":{"cited_paper":"/paper/2503.23829","citing_paper":"/paper/2607.00139"},"observation_digest":"sha256:78b55b2c9a4d6532149ef1de0328e95b30122d794776ee0125c9efbe87c45104","observation_id":"61f6e4fe-1eae-489a-950e-6014c1940867","resolution":{"observed_at":"2026-07-02T19:27:18.482991Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.23829","last_updated":"2025-04-01T14:48:02Z","snapshot_observed_at":"2026-08-16T12:45:26.696220Z","submitted_at":"2025-03-31T08:22:49Z","title":"Crossing the Reward Bridge: Expanding RL with Verifiable Rewards Across Diverse Domains","version":2},"cited_work":{"arxiv_id":"2503.23829","doi":"10.48550/arxiv.2503.23829","metadata_source":"arxiv_reference","pith_arxiv_id":"2503.23829","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Crossing the reward bridge: Expanding RL with verifiable rewards across diverse domains","venue":"ArXiv.org","work_id":"a1dbfba1-b433-4260-abc6-bf28628844b9","year":2025},"citing_paper":{"arxiv_id":"2607.02407","last_updated":"2026-07-02T16:40:08Z","snapshot_observed_at":"2026-08-14T16:50:42.382400Z","submitted_at":"2026-07-02T16:40:08Z","title":"Text-Driven 3D Indoor Scene Synthesis in Non-Manhattan Environments","version":1},"reference_index":67,"source":"arxiv_source","source_observed_at":"2026-07-03T13:21:06.380698Z"},"links":{"cited_paper":"/paper/2503.23829","citing_paper":"/paper/2607.02407"},"observation_digest":"sha256:282f21255e8c0c998389acf1012c94d466ce8711ea1eee66fc237d642bc9f079","observation_id":"0c369fed-3427-4cc4-84b1-b2f2437d9bc2","resolution":{"observed_at":"2026-07-03T13:28:18.294461Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.23829","last_updated":"2025-04-01T14:48:02Z","snapshot_observed_at":"2026-08-16T12:45:26.696220Z","submitted_at":"2025-03-31T08:22:49Z","title":"Crossing the Reward Bridge: Expanding RL with Verifiable Rewards Across Diverse Domains","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.23829","snapshot_observed_at":"2026-08-06T00:39:15.338019Z","title":"arXiv preprint arXiv:2503.23829 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01012","last_updated":"2026-08-02T05:27:21Z","snapshot_observed_at":"2026-08-15T18:04:13.511857Z","submitted_at":"2026-08-02T05:27:21Z","title":"MedUPS: Towards Diagnostic Assistance in Uncommon Medical Cases with Large Language Models","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-06T00:39:15.338019Z"},"links":{"cited_paper":"/paper/2503.23829","citing_paper":"/paper/2608.01012"},"observation_digest":"sha256:cb4e89188a8121d53a3be29372f8978a8c9146dd5596eb1b50d684a55e6b3dd5","observation_id":"66b68307-6bdc-4878-ab54-31e38b2cac55","resolution":{"observed_at":"2026-08-06T00:39:15.338019Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.23829","last_updated":"2025-04-01T14:48:02Z","snapshot_observed_at":"2026-08-16T12:45:26.696220Z","submitted_at":"2025-03-31T08:22:49Z","title":"Crossing the Reward Bridge: Expanding RL with Verifiable Rewards Across Diverse Domains","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.23829","snapshot_observed_at":"2026-08-08T00:57:30.487540Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.03119","last_updated":"2026-08-04T04:41:20Z","snapshot_observed_at":"2026-08-15T02:39:38.956585Z","submitted_at":"2026-08-04T04:41:20Z","title":"Don't Peek at the Answer: Outcome-Masked Group Relative Policy Optimization for Label-Free RLVR","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-08T00:57:30.487540Z"},"links":{"cited_paper":"/paper/2503.23829","citing_paper":"/paper/2608.03119"},"observation_digest":"sha256:ebd6084055f906508af106255ec3d02c954cf5f5ec2a354219566f6d3833ccaf","observation_id":"52e9b7ae-8a61-4a64-b77f-673325afb5da","resolution":{"observed_at":"2026-08-08T00:57:30.487540Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.23829","last_updated":"2025-04-01T14:48:02Z","snapshot_observed_at":"2026-08-16T12:45:26.696220Z","submitted_at":"2025-03-31T08:22:49Z","title":"Crossing the Reward Bridge: Expanding RL with Verifiable Rewards Across Diverse Domains","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.23829","snapshot_observed_at":"2026-08-06T10:46:10.723383Z","title":"arXiv preprint arXiv:2503.23829 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05045","last_updated":"2026-08-05T16:55:59Z","snapshot_observed_at":"2026-08-14T07:30:28.587735Z","submitted_at":"2026-08-05T16:55:59Z","title":"Gradient Immunity: Null-Space Resistance to Malicious Fine-Tuning","version":1},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-08-06T10:46:10.723383Z"},"links":{"cited_paper":"/paper/2503.23829","citing_paper":"/paper/2608.05045"},"observation_digest":"sha256:b60ebfa23415e8232cbb8d43ccba8f119a6b1115a61a646a5565e9b30211864c","observation_id":"2707c228-3d18-4c3a-96b0-dd1d011bc224","resolution":{"observed_at":"2026-08-06T10:46:10.723383Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.23829","last_updated":"2025-04-01T14:48:02Z","snapshot_observed_at":"2026-08-16T12:45:26.696220Z","submitted_at":"2025-03-31T08:22:49Z","title":"Crossing the Reward Bridge: Expanding RL with Verifiable Rewards Across Diverse Domains","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.23829","snapshot_observed_at":"2026-08-14T04:33:18.256691Z","title":"arXiv preprint arXiv:2503.23829 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.08623","last_updated":"2026-08-09T10:13:20Z","snapshot_observed_at":"2026-08-15T12:03:13.382115Z","submitted_at":"2026-08-09T10:13:20Z","title":"MedCalc-R1: Knowledge-Guided Reward Framework for Medical Mathematical Reasoning","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-14T04:33:18.256691Z"},"links":{"cited_paper":"/paper/2503.23829","citing_paper":"/paper/2608.08623"},"observation_digest":"sha256:a158050f8c7b5ef9759e0a2751c49eed05373405abb813a5352f4e10dccaad88","observation_id":"4c2611e7-fe7e-4729-8abe-f6948bf32ead","resolution":{"observed_at":"2026-08-14T04:33:18.256691Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.23829","last_updated":"2025-04-01T14:48:02Z","snapshot_observed_at":"2026-08-16T12:45:26.696220Z","submitted_at":"2025-03-31T08:22:49Z","title":"Crossing the Reward Bridge: Expanding RL with Verifiable Rewards Across Diverse Domains","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.23829","snapshot_observed_at":"2026-08-11T20:29:03.935373Z","title":"Crossing the reward bridge: Expanding rl with verifiable rewards across diverse domains.arXiv preprint arXiv:2503.23829, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.09271","last_updated":"2026-08-10T08:27:15Z","snapshot_observed_at":"2026-08-14T19:37:44.330209Z","submitted_at":"2026-08-10T08:27:15Z","title":"SoftmaxGRPO: Learning to Reason using Softmax Advantage Group Estimation","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-11T20:29:03.935373Z"},"links":{"cited_paper":"/paper/2503.23829","citing_paper":"/paper/2608.09271"},"observation_digest":"sha256:919feac8895997d2616f010d62cacc0864ed0dd4d3c7191d91a76fb6fdaffb01","observation_id":"c91d0b00-6ba4-407d-9136-bf043f5db81e","resolution":{"observed_at":"2026-08-11T20:29:03.935373Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2503.23829/citation-record","integrity":"/paper/2503.23829/integrity","json":"/paper/2503.23829/citation-record.json","paper":"/paper/2503.23829"},"outbound":[],"paper":{"arxiv_id":"2503.23829","last_updated":"2025-04-01T14:48:02Z","latest_version":2,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-16T12:45:26.696220Z","submitted_at":"2025-03-31T08:22:49Z","title":"Crossing the Reward Bridge: Expanding RL with Verifiable Rewards Across Diverse Domains"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"thesis":"As of 18 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 51 inbound Pith citation observations for arXiv:2503.23829."}