{"as_of":"2026-08-14T01:46:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:768659076b1c93afca94bd1a855ab6bd471bfde02bc6d0bc505275aaf64cfc2f","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":25,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":25,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-13T06:32:02.005865+00:00","state":"measured"},{"denominator":25,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":25,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T14:53:04.646543Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T06:29:38.225670Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.18254","last_updated":"2025-06-23T02:56:36Z","snapshot_observed_at":"2026-08-07T10:52:25.270682Z","submitted_at":"2025-06-23T02:56:36Z","title":"RLPR: Extrapolating RLVR to General Domains without Verifiers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.18254","snapshot_observed_at":"2026-08-06T14:53:04.646543Z","title":"Rlpr: Extrapolating rlvr to general domains without verifiers","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.17512","last_updated":"2025-07-23T13:51:04Z","snapshot_observed_at":"2026-08-09T23:40:29.433863Z","submitted_at":"2025-07-23T13:51:04Z","title":"Can One Domain Help Others? A Data-Centric Study on Multi-Domain Reasoning via Reinforcement Learning","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T14:53:04.646543Z"},"links":{"cited_paper":"/paper/2506.18254","citing_paper":"/paper/2507.17512"},"observation_digest":"sha256:59e49fa89971fd102b5b0380dec581747212807a6565375c8254e2e59534fac4","observation_id":"79755e74-e6e5-458f-b5dd-2e89aacd48ca","resolution":{"observed_at":"2026-08-06T14:53:04.646543Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.18254","last_updated":"2025-06-23T02:56:36Z","snapshot_observed_at":"2026-08-07T10:52:25.270682Z","submitted_at":"2025-06-23T02:56:36Z","title":"RLPR: Extrapolating RLVR to General Domains without Verifiers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.18254","snapshot_observed_at":"2026-08-05T23:29:17.022564Z","title":"Rlpr: Extrapolating rlvr to general domains without verifiers.arXiv preprint arXiv:2506.18254, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.05383","last_updated":"2025-08-07T13:31:21Z","snapshot_observed_at":"2026-08-08T12:45:30.983934Z","submitted_at":"2025-08-07T13:31:21Z","title":"StructVRM: Aligning Multimodal Reasoning with Structured and Verifiable Reward Models","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-05T23:29:17.022564Z"},"links":{"cited_paper":"/paper/2506.18254","citing_paper":"/paper/2508.05383"},"observation_digest":"sha256:b70a66eb4dabbf7b01683a11a265d2be3ca59537577d8594e83075aba8ff4221","observation_id":"8969b9a4-7393-42e5-95c1-4d046f3c9338","resolution":{"observed_at":"2026-08-05T23:29:17.022564Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.18254","last_updated":"2025-06-23T02:56:36Z","snapshot_observed_at":"2026-08-07T10:52:25.270682Z","submitted_at":"2025-06-23T02:56:36Z","title":"RLPR: Extrapolating RLVR to General Domains without Verifiers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.18254","snapshot_observed_at":"2026-08-05T23:25:50.287093Z","title":"Rlpr: Extrapolating rlvr to general domains without verifiers.arXiv preprint arXiv:2506.18254, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.05388","last_updated":"2025-08-07T13:38:49Z","snapshot_observed_at":"2026-08-06T12:42:41.700036Z","submitted_at":"2025-08-07T13:38:49Z","title":"An Explainable Machine Learning Framework for Railway Predictive Maintenance using Data Streams from the Metro Operator of Portugal","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-05T23:25:50.287093Z"},"links":{"cited_paper":"/paper/2506.18254","citing_paper":"/paper/2508.05388"},"observation_digest":"sha256:e5cf9b0c333defcb1a3a45fbe2bcfca4f5ec968e0ebceacdff7de1f8067944fe","observation_id":"8c1750ea-d176-45cf-a88a-bc2dd7c10d68","resolution":{"observed_at":"2026-08-05T23:25:50.287093Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.18254","last_updated":"2025-06-23T02:56:36Z","snapshot_observed_at":"2026-08-07T10:52:25.270682Z","submitted_at":"2025-06-23T02:56:36Z","title":"RLPR: Extrapolating RLVR to General Domains without Verifiers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.18254","snapshot_observed_at":"2026-08-05T23:07:12.004152Z","title":"In Al-Onaizan, Y .; Bansal, M.; and Chen, Y .-N., eds.,Proceedings of the 2024 Confer- ence on Empirical Methods in Natural Language Process- ing, 21424–21439","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.05913","last_updated":"2025-08-08T00:27:50Z","snapshot_observed_at":"2026-08-13T11:47:45.235027Z","submitted_at":"2025-08-08T00:27:50Z","title":"Do Ethical AI Principles Matter to Users? A Large-Scale Analysis of User Sentiment and Satisfaction","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-05T23:07:12.004152Z"},"links":{"cited_paper":"/paper/2506.18254","citing_paper":"/paper/2508.05913"},"observation_digest":"sha256:13bdad18895aced93cda70dc4d44c815fe6794f336699927f6b05ebf875fae60","observation_id":"06e66c7c-7c58-4988-8903-f54b84e49500","resolution":{"observed_at":"2026-08-05T23:07:12.004152Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.18254","last_updated":"2025-06-23T02:56:36Z","snapshot_observed_at":"2026-08-07T10:52:25.270682Z","submitted_at":"2025-06-23T02:56:36Z","title":"RLPR: Extrapolating RLVR to General Domains without Verifiers","version":1},"cited_work":{"arxiv_id":"2506.18254","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.18254","snapshot_observed_at":"2026-07-04T06:29:38.225670Z","title":"RLPR: Extrapolating RLVR to general domains without verifiers.arXiv preprint arXiv:2506.18254","venue":null,"work_id":"bfa10c9c-ac28-4d18-80d0-26a0bae3986f","year":2025},"citing_paper":{"arxiv_id":"2509.14234","last_updated":"2026-05-09T12:06:02Z","snapshot_observed_at":"2026-08-13T02:26:26.115035Z","submitted_at":"2025-09-17T17:59:42Z","title":"Compute as Teacher: Turning Inference Compute Into Reference-Free Supervision","version":3},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-18T15:45:09.730804Z"},"links":{"cited_paper":"/paper/2506.18254","citing_paper":"/paper/2509.14234"},"observation_digest":"sha256:f7f5f052165d2c92b1da66744e1232f621660b7c0e1244d03b6ab4938445c347","observation_id":"86079210-c35f-4451-aea5-043af72958f2","resolution":{"observed_at":"2026-05-18T15:46:34.115346Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.18254","last_updated":"2025-06-23T02:56:36Z","snapshot_observed_at":"2026-08-07T10:52:25.270682Z","submitted_at":"2025-06-23T02:56:36Z","title":"RLPR: Extrapolating RLVR to General Domains without Verifiers","version":1},"cited_work":{"arxiv_id":"2506.18254","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.18254","snapshot_observed_at":"2026-07-04T06:29:38.225670Z","title":"RLPR: Extrapolating RLVR to general domains without verifiers.arXiv preprint arXiv:2506.18254","venue":null,"work_id":"bfa10c9c-ac28-4d18-80d0-26a0bae3986f","year":2025},"citing_paper":{"arxiv_id":"2512.04695","last_updated":"2026-04-27T04:31:24Z","snapshot_observed_at":"2026-08-13T03:30:11.513394Z","submitted_at":"2025-12-04T11:45:21Z","title":"TRINITY: An Evolved LLM Coordinator","version":3},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-17T01:19:10.420266Z"},"links":{"cited_paper":"/paper/2506.18254","citing_paper":"/paper/2512.04695"},"observation_digest":"sha256:f0d7757f208d95a3383ba7f1c8adb99430f70f47b49d0ecbd37e1ba3cd61fd11","observation_id":"054c9827-e6dc-4db5-8108-e7bc3b7f6fd8","resolution":{"observed_at":"2026-05-17T01:21:24.781976Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.18254","last_updated":"2025-06-23T02:56:36Z","snapshot_observed_at":"2026-08-07T10:52:25.270682Z","submitted_at":"2025-06-23T02:56:36Z","title":"RLPR: Extrapolating RLVR to General Domains without Verifiers","version":1},"cited_work":{"arxiv_id":"2506.18254","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.18254","snapshot_observed_at":"2026-07-04T06:29:38.225670Z","title":"RLPR: Extrapolating RLVR to general domains without verifiers.arXiv preprint arXiv:2506.18254","venue":null,"work_id":"bfa10c9c-ac28-4d18-80d0-26a0bae3986f","year":2025},"citing_paper":{"arxiv_id":"2604.08905","last_updated":"2026-04-10T03:13:19Z","snapshot_observed_at":"2026-08-12T16:30:38.536151Z","submitted_at":"2026-04-10T03:13:19Z","title":"StaRPO: Stability-Augmented Reinforcement Policy Optimization","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-10T18:11:49.056805Z"},"links":{"cited_paper":"/paper/2506.18254","citing_paper":"/paper/2604.08905"},"observation_digest":"sha256:3d2ee1ba5fbe16e3f93b2f5db0e02f4f8c97ee8a56e482a1a8950d26cb26cbd8","observation_id":"2b790b15-16be-4b3e-9cfc-f1531b9f4188","resolution":{"observed_at":"2026-05-11T05:20:59.963670Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.18254","last_updated":"2025-06-23T02:56:36Z","snapshot_observed_at":"2026-08-07T10:52:25.270682Z","submitted_at":"2025-06-23T02:56:36Z","title":"RLPR: Extrapolating RLVR to General Domains without Verifiers","version":1},"cited_work":{"arxiv_id":"2506.18254","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.18254","snapshot_observed_at":"2026-07-04T06:29:38.225670Z","title":"RLPR: Extrapolating RLVR to general domains without verifiers.arXiv preprint arXiv:2506.18254","venue":null,"work_id":"bfa10c9c-ac28-4d18-80d0-26a0bae3986f","year":2025},"citing_paper":{"arxiv_id":"2604.10110","last_updated":"2026-04-11T09:08:27Z","snapshot_observed_at":"2026-08-13T14:52:06.768478Z","submitted_at":"2026-04-11T09:08:27Z","title":"Trust Your Memory: Verifiable Control of Smart Homes through Reinforcement Learning with Multi-dimensional Rewards","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-10T16:49:00.343580Z"},"links":{"cited_paper":"/paper/2506.18254","citing_paper":"/paper/2604.10110"},"observation_digest":"sha256:d5980b45ae842c35c47ebdbbd71eb307e968d73a63aed657050191cbef9ce6f6","observation_id":"c47942a3-ba62-454a-aa9f-655e9224bdec","resolution":{"observed_at":"2026-05-11T08:06:01.178591Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.18254","last_updated":"2025-06-23T02:56:36Z","snapshot_observed_at":"2026-08-07T10:52:25.270682Z","submitted_at":"2025-06-23T02:56:36Z","title":"RLPR: Extrapolating RLVR to General Domains without Verifiers","version":1},"cited_work":{"arxiv_id":"2506.18254","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.18254","snapshot_observed_at":"2026-07-04T06:29:38.225670Z","title":"RLPR: Extrapolating RLVR to general domains without verifiers.arXiv preprint arXiv:2506.18254","venue":null,"work_id":"bfa10c9c-ac28-4d18-80d0-26a0bae3986f","year":2025},"citing_paper":{"arxiv_id":"2604.17928","last_updated":"2026-04-20T08:09:01Z","snapshot_observed_at":"2026-08-14T00:24:03.820656Z","submitted_at":"2026-04-20T08:09:01Z","title":"HEALing Entropy Collapse: Enhancing Exploration in Few-Shot RLVR via Hybrid-Domain Entropy Dynamics Alignment","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-05-10T05:23:08.478393Z"},"links":{"cited_paper":"/paper/2506.18254","citing_paper":"/paper/2604.17928"},"observation_digest":"sha256:ff826d0e268fb013ec00c5e8aa1152c61b102c0af1fe4767285528eba2235aed","observation_id":"3a2be3a4-1eb2-4e55-bd07-8f2556bdeb5d","resolution":{"observed_at":"2026-05-10T05:25:55.287022Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.18254","last_updated":"2025-06-23T02:56:36Z","snapshot_observed_at":"2026-08-07T10:52:25.270682Z","submitted_at":"2025-06-23T02:56:36Z","title":"RLPR: Extrapolating RLVR to General Domains without Verifiers","version":1},"cited_work":{"arxiv_id":"2506.18254","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.18254","snapshot_observed_at":"2026-07-04T06:29:38.225670Z","title":"RLPR: Extrapolating RLVR to general domains without verifiers.arXiv preprint arXiv:2506.18254","venue":null,"work_id":"bfa10c9c-ac28-4d18-80d0-26a0bae3986f","year":2025},"citing_paper":{"arxiv_id":"2605.02913","last_updated":"2026-04-08T00:53:29Z","snapshot_observed_at":"2026-08-13T10:36:16.468710Z","submitted_at":"2026-04-08T00:53:29Z","title":"Generate, Filter, Control, Replay: A Comprehensive Survey of Rollout Strategies for LLM Reinforcement Learning","version":1},"reference_index":160,"source":"arxiv_source","source_observed_at":"2026-05-10T19:15:27.406778Z"},"links":{"cited_paper":"/paper/2506.18254","citing_paper":"/paper/2605.02913"},"observation_digest":"sha256:e97349e5b96109a89c83f6d6e94e4ac1347d7798e6da0b23f5547b98ff76d4c9","observation_id":"edb6943d-e58d-4e84-8861-e882d01b06da","resolution":{"observed_at":"2026-05-10T23:15:49.503384Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.18254","last_updated":"2025-06-23T02:56:36Z","snapshot_observed_at":"2026-08-07T10:52:25.270682Z","submitted_at":"2025-06-23T02:56:36Z","title":"RLPR: Extrapolating RLVR to General Domains without Verifiers","version":1},"cited_work":{"arxiv_id":"2506.18254","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.18254","snapshot_observed_at":"2026-07-04T06:29:38.225670Z","title":"RLPR: Extrapolating RLVR to general domains without verifiers.arXiv preprint arXiv:2506.18254","venue":null,"work_id":"bfa10c9c-ac28-4d18-80d0-26a0bae3986f","year":2025},"citing_paper":{"arxiv_id":"2605.09959","last_updated":"2026-05-11T04:12:34Z","snapshot_observed_at":"2026-08-11T16:16:11.008726Z","submitted_at":"2026-05-11T04:12:34Z","title":"G-Zero: Self-Play for Open-Ended Generation from Zero Data","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-12T03:39:40.780801Z"},"links":{"cited_paper":"/paper/2506.18254","citing_paper":"/paper/2605.09959"},"observation_digest":"sha256:5855980eba67c102c43f009b601f5aecf603e8c8c1766e4613a0b84287f140e6","observation_id":"85edc4c9-1f3d-4cd6-af42-7efe2ab62f6f","resolution":{"observed_at":"2026-05-12T07:11:24.558508Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.18254","last_updated":"2025-06-23T02:56:36Z","snapshot_observed_at":"2026-08-07T10:52:25.270682Z","submitted_at":"2025-06-23T02:56:36Z","title":"RLPR: Extrapolating RLVR to General Domains without Verifiers","version":1},"cited_work":{"arxiv_id":"2506.18254","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.18254","snapshot_observed_at":"2026-07-04T06:29:38.225670Z","title":"RLPR: Extrapolating RLVR to general domains without verifiers.arXiv preprint arXiv:2506.18254","venue":null,"work_id":"bfa10c9c-ac28-4d18-80d0-26a0bae3986f","year":2025},"citing_paper":{"arxiv_id":"2605.10810","last_updated":"2026-05-15T15:01:38Z","snapshot_observed_at":"2026-08-12T16:29:47.459756Z","submitted_at":"2026-05-11T16:32:06Z","title":"Likelihood scoring for continuations of mathematical text: a self-supervised benchmark with tests for shortcut vulnerabilities","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-19T17:20:39.969447Z"},"links":{"cited_paper":"/paper/2506.18254","citing_paper":"/paper/2605.10810"},"observation_digest":"sha256:0839752123d002184cbf9f3c33d72367729de42f995fa2f33e35e60184f021f0","observation_id":"72cb19f3-c96d-4734-b47f-68a9b6dacd23","resolution":{"observed_at":"2026-05-19T17:22:41.998128Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.18254","last_updated":"2025-06-23T02:56:36Z","snapshot_observed_at":"2026-08-07T10:52:25.270682Z","submitted_at":"2025-06-23T02:56:36Z","title":"RLPR: Extrapolating RLVR to General Domains without Verifiers","version":1},"cited_work":{"arxiv_id":"2506.18254","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.18254","snapshot_observed_at":"2026-07-04T06:29:38.225670Z","title":"RLPR: Extrapolating RLVR to general domains without verifiers.arXiv preprint arXiv:2506.18254","venue":null,"work_id":"bfa10c9c-ac28-4d18-80d0-26a0bae3986f","year":2025},"citing_paper":{"arxiv_id":"2605.11505","last_updated":"2026-05-13T06:41:19Z","snapshot_observed_at":"2026-08-12T14:20:35.464221Z","submitted_at":"2026-05-12T04:25:41Z","title":"Selective Off-Policy Reference Tuning with Plan Guidance","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-13T01:28:18.615371Z"},"links":{"cited_paper":"/paper/2506.18254","citing_paper":"/paper/2605.11505"},"observation_digest":"sha256:4205c2217aa30188178c3768d0135bb0e9b233d16cad7c5627d9505b9200a511","observation_id":"901cfdcf-ce73-4be3-b531-742fd2ea79ef","resolution":{"observed_at":"2026-05-13T01:47:05.185587Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.18254","last_updated":"2025-06-23T02:56:36Z","snapshot_observed_at":"2026-08-07T10:52:25.270682Z","submitted_at":"2025-06-23T02:56:36Z","title":"RLPR: Extrapolating RLVR to General Domains without Verifiers","version":1},"cited_work":{"arxiv_id":"2506.18254","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.18254","snapshot_observed_at":"2026-07-04T06:29:38.225670Z","title":"RLPR: Extrapolating RLVR to general domains without verifiers.arXiv preprint arXiv:2506.18254","venue":null,"work_id":"bfa10c9c-ac28-4d18-80d0-26a0bae3986f","year":2025},"citing_paper":{"arxiv_id":"2605.11505","last_updated":"2026-05-13T06:41:19Z","snapshot_observed_at":"2026-08-12T14:20:35.464221Z","submitted_at":"2026-05-12T04:25:41Z","title":"Selective Off-Policy Reference Tuning with Plan Guidance","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-14T21:20:24.066520Z"},"links":{"cited_paper":"/paper/2506.18254","citing_paper":"/paper/2605.11505"},"observation_digest":"sha256:6dad7dbbe8c6027420c3fb6a7a9cd3571e4ae194967d1d4ec80ded8dd3ce16a2","observation_id":"de309758-8d6d-4c05-9cdc-a0fcca03b0d7","resolution":{"observed_at":"2026-05-14T21:22:59.347610Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.18254","last_updated":"2025-06-23T02:56:36Z","snapshot_observed_at":"2026-08-07T10:52:25.270682Z","submitted_at":"2025-06-23T02:56:36Z","title":"RLPR: Extrapolating RLVR to General Domains without Verifiers","version":1},"cited_work":{"arxiv_id":"2506.18254","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.18254","snapshot_observed_at":"2026-07-04T06:29:38.225670Z","title":"RLPR: Extrapolating RLVR to general domains without verifiers.arXiv preprint arXiv:2506.18254","venue":null,"work_id":"bfa10c9c-ac28-4d18-80d0-26a0bae3986f","year":2025},"citing_paper":{"arxiv_id":"2605.21235","last_updated":"2026-05-20T14:24:11Z","snapshot_observed_at":"2026-08-12T22:42:33.005869Z","submitted_at":"2026-05-20T14:24:11Z","title":"LamPO: A Lambda Style Policy Optimization for Reasoning Language Models","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-21T05:11:35.785227Z"},"links":{"cited_paper":"/paper/2506.18254","citing_paper":"/paper/2605.21235"},"observation_digest":"sha256:611c9aeda33a8979b5345dd5b31f6778da966707b8cb8360cecaf7dd0f644b93","observation_id":"d5447ff0-8b0c-4b8d-ab76-5f6809095f65","resolution":{"observed_at":"2026-05-21T05:13:58.419624Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.18254","last_updated":"2025-06-23T02:56:36Z","snapshot_observed_at":"2026-08-07T10:52:25.270682Z","submitted_at":"2025-06-23T02:56:36Z","title":"RLPR: Extrapolating RLVR to General Domains without Verifiers","version":1},"cited_work":{"arxiv_id":"2506.18254","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.18254","snapshot_observed_at":"2026-07-04T06:29:38.225670Z","title":"RLPR: Extrapolating RLVR to general domains without verifiers.arXiv preprint arXiv:2506.18254","venue":null,"work_id":"bfa10c9c-ac28-4d18-80d0-26a0bae3986f","year":2025},"citing_paper":{"arxiv_id":"2605.31058","last_updated":"2026-05-29T09:29:32Z","snapshot_observed_at":"2026-08-04T04:33:32.255796Z","submitted_at":"2026-05-29T09:29:32Z","title":"Combinatorial Synthesis: Scaling Code RLVR via Atomic Decomposition and Recombination","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-06-28T23:08:05.597810Z"},"links":{"cited_paper":"/paper/2506.18254","citing_paper":"/paper/2605.31058"},"observation_digest":"sha256:cc0475e221c8ef76451c380d62de651902c83bc27af5b7fcc79e8aad10e21740","observation_id":"2571351c-abdd-42c0-88d9-539d5988e6cb","resolution":{"observed_at":"2026-06-28T23:12:47.141445Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.18254","last_updated":"2025-06-23T02:56:36Z","snapshot_observed_at":"2026-08-07T10:52:25.270682Z","submitted_at":"2025-06-23T02:56:36Z","title":"RLPR: Extrapolating RLVR to General Domains without Verifiers","version":1},"cited_work":{"arxiv_id":"2506.18254","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.18254","snapshot_observed_at":"2026-07-04T06:29:38.225670Z","title":"RLPR: Extrapolating RLVR to general domains without verifiers.arXiv preprint arXiv:2506.18254","venue":null,"work_id":"bfa10c9c-ac28-4d18-80d0-26a0bae3986f","year":2025},"citing_paper":{"arxiv_id":"2606.00609","last_updated":"2026-05-30T08:18:40Z","snapshot_observed_at":"2026-08-12T22:34:53.432641Z","submitted_at":"2026-05-30T08:18:40Z","title":"CARE-RL: Capability-Aware Reinforcement Learning for Mitigating Cross-Domain Conflicts","version":1},"reference_index":78,"source":"arxiv_source","source_observed_at":"2026-06-28T19:01:14.340754Z"},"links":{"cited_paper":"/paper/2506.18254","citing_paper":"/paper/2606.00609"},"observation_digest":"sha256:603efc2bc2a38ee5502f7fd7705d4d84993775d5db689ad30556b635b94b981c","observation_id":"01487990-7a6a-4622-869a-f7e4c6e99a89","resolution":{"observed_at":"2026-06-28T19:02:34.047073Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.18254","last_updated":"2025-06-23T02:56:36Z","snapshot_observed_at":"2026-08-07T10:52:25.270682Z","submitted_at":"2025-06-23T02:56:36Z","title":"RLPR: Extrapolating RLVR to General Domains without Verifiers","version":1},"cited_work":{"arxiv_id":"2506.18254","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.18254","snapshot_observed_at":"2026-07-04T06:29:38.225670Z","title":"RLPR: Extrapolating RLVR to general domains without verifiers.arXiv preprint arXiv:2506.18254","venue":null,"work_id":"bfa10c9c-ac28-4d18-80d0-26a0bae3986f","year":2025},"citing_paper":{"arxiv_id":"2606.01249","last_updated":"2026-06-17T04:44:10Z","snapshot_observed_at":"2026-08-12T03:28:30.781632Z","submitted_at":"2026-05-31T14:04:51Z","title":"Trust Region On-Policy Distillation","version":3},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-06-28T17:38:50.313305Z"},"links":{"cited_paper":"/paper/2506.18254","citing_paper":"/paper/2606.01249"},"observation_digest":"sha256:72fb50bc2c017e5b285a60e5d7005ba61da1ddb9d507fc69ac99ba774c5dc5e6","observation_id":"67d565f6-b0ee-485c-81a4-c78fa1535f7f","resolution":{"observed_at":"2026-07-01T20:56:13.380190Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.18254","last_updated":"2025-06-23T02:56:36Z","snapshot_observed_at":"2026-08-07T10:52:25.270682Z","submitted_at":"2025-06-23T02:56:36Z","title":"RLPR: Extrapolating RLVR to General Domains without Verifiers","version":1},"cited_work":{"arxiv_id":"2506.18254","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.18254","snapshot_observed_at":"2026-07-04T06:29:38.225670Z","title":"RLPR: Extrapolating RLVR to general domains without verifiers.arXiv preprint arXiv:2506.18254","venue":null,"work_id":"bfa10c9c-ac28-4d18-80d0-26a0bae3986f","year":2025},"citing_paper":{"arxiv_id":"2606.04516","last_updated":"2026-06-03T06:47:50Z","snapshot_observed_at":"2026-07-06T23:44:37.797802Z","submitted_at":"2026-06-03T06:47:50Z","title":"GeoMin: Data-Efficient Semi-Supervised RLVR via Geometric Distribution Modeling","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-06-28T07:45:43.320339Z"},"links":{"cited_paper":"/paper/2506.18254","citing_paper":"/paper/2606.04516"},"observation_digest":"sha256:1e3135c34fc0cb9be89ba92aceaa8e0d47f570b80eb6a1afae04bc5dad1723ff","observation_id":"7b35d5da-b98f-4acc-a2b8-543a0c429259","resolution":{"observed_at":"2026-07-02T06:06:40.808650Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.18254","last_updated":"2025-06-23T02:56:36Z","snapshot_observed_at":"2026-08-07T10:52:25.270682Z","submitted_at":"2025-06-23T02:56:36Z","title":"RLPR: Extrapolating RLVR to General Domains without Verifiers","version":1},"cited_work":{"arxiv_id":"2506.18254","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.18254","snapshot_observed_at":"2026-07-04T06:29:38.225670Z","title":"RLPR: Extrapolating RLVR to general domains without verifiers.arXiv preprint arXiv:2506.18254","venue":null,"work_id":"bfa10c9c-ac28-4d18-80d0-26a0bae3986f","year":2025},"citing_paper":{"arxiv_id":"2606.09380","last_updated":"2026-06-08T11:57:17Z","snapshot_observed_at":"2026-08-02T13:37:53.223013Z","submitted_at":"2026-06-08T11:57:17Z","title":"Reasoning Arena: Trace Tournaments When Verifiable Rewards Fall Short","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-06-27T17:18:03.459289Z"},"links":{"cited_paper":"/paper/2506.18254","citing_paper":"/paper/2606.09380"},"observation_digest":"sha256:976d19b0cedd68765a078f6cbe5c2b8cff7b76e30edb4bc9717bce7e7ea8d6d3","observation_id":"1e2ad807-18ad-4438-a044-3e8a0c8d781a","resolution":{"observed_at":"2026-07-03T00:17:29.542547Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.18254","last_updated":"2025-06-23T02:56:36Z","snapshot_observed_at":"2026-08-07T10:52:25.270682Z","submitted_at":"2025-06-23T02:56:36Z","title":"RLPR: Extrapolating RLVR to General Domains without Verifiers","version":1},"cited_work":{"arxiv_id":"2506.18254","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.18254","snapshot_observed_at":"2026-07-04T06:29:38.225670Z","title":"RLPR: Extrapolating RLVR to general domains without verifiers.arXiv preprint arXiv:2506.18254","venue":null,"work_id":"bfa10c9c-ac28-4d18-80d0-26a0bae3986f","year":2025},"citing_paper":{"arxiv_id":"2606.09393","last_updated":"2026-06-08T12:09:20Z","snapshot_observed_at":"2026-08-07T21:51:25.793927Z","submitted_at":"2026-06-08T12:09:20Z","title":"CapRL++: Unified Reinforcement Learning with Verifiable Rewards for Dense Image and Video Captioning","version":1},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-06-27T17:21:38.543724Z"},"links":{"cited_paper":"/paper/2506.18254","citing_paper":"/paper/2606.09393"},"observation_digest":"sha256:1469ef4342210354828bed22a7fc07b69a1a81cc3e92f8c04f05cb542d94fe68","observation_id":"b3e06ca5-3c98-46a5-a471-ab315d6f3d88","resolution":{"observed_at":"2026-07-03T00:17:29.006584Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.18254","last_updated":"2025-06-23T02:56:36Z","snapshot_observed_at":"2026-08-07T10:52:25.270682Z","submitted_at":"2025-06-23T02:56:36Z","title":"RLPR: Extrapolating RLVR to General Domains without Verifiers","version":1},"cited_work":{"arxiv_id":"2506.18254","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.18254","snapshot_observed_at":"2026-07-04T06:29:38.225670Z","title":"RLPR: Extrapolating RLVR to general domains without verifiers.arXiv preprint arXiv:2506.18254","venue":null,"work_id":"bfa10c9c-ac28-4d18-80d0-26a0bae3986f","year":2025},"citing_paper":{"arxiv_id":"2606.21228","last_updated":"2026-06-23T04:40:39Z","snapshot_observed_at":"2026-08-11T18:07:40.444367Z","submitted_at":"2026-06-19T08:47:40Z","title":"Sakana Fugu Technical Report","version":2},"reference_index":243,"source":"arxiv_source","source_observed_at":"2026-06-26T14:22:37.596720Z"},"links":{"cited_paper":"/paper/2506.18254","citing_paper":"/paper/2606.21228"},"observation_digest":"sha256:e96526a36a082e62556b317bc277eaae68800d875fca48cecc6070b4150b1a8f","observation_id":"91a78fa8-cb7c-40a4-be49-3ff58b70e6b9","resolution":{"observed_at":"2026-07-04T06:29:38.227309Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.18254","last_updated":"2025-06-23T02:56:36Z","snapshot_observed_at":"2026-08-07T10:52:25.270682Z","submitted_at":"2025-06-23T02:56:36Z","title":"RLPR: Extrapolating RLVR to General Domains without Verifiers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.18254","snapshot_observed_at":"2026-08-01T12:46:04.176578Z","title":"Dapo: An open-source llm reinforcement learning system at scale","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.19345","last_updated":"2026-07-31T16:09:53Z","snapshot_observed_at":"2026-08-10T19:52:35.716241Z","submitted_at":"2026-07-21T17:59:21Z","title":"Copy Less, Ground More: Overcoming Repetitive Copying in Long-Context Reasoning via Evidence-Aware Reinforcement Learning","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-01T12:46:04.176578Z"},"links":{"cited_paper":"/paper/2506.18254","citing_paper":"/paper/2607.19345"},"observation_digest":"sha256:d791bcb9ff1e79984eb077b71708c871e1b71ab0c1f4510c2ba9678a47322d20","observation_id":"3ecd9f5c-fb34-47fb-93e2-e73d4881b216","resolution":{"observed_at":"2026-08-01T12:46:04.176578Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.18254","last_updated":"2025-06-23T02:56:36Z","snapshot_observed_at":"2026-08-07T10:52:25.270682Z","submitted_at":"2025-06-23T02:56:36Z","title":"RLPR: Extrapolating RLVR to General Domains without Verifiers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.18254","snapshot_observed_at":"2026-08-03T01:57:53.821375Z","title":"Dapo: An open-source llm reinforcement learning system at scale","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.19345","last_updated":"2026-07-31T16:09:53Z","snapshot_observed_at":"2026-08-10T19:52:35.716241Z","submitted_at":"2026-07-21T17:59:21Z","title":"Copy Less, Ground More: Overcoming Repetitive Copying in Long-Context Reasoning via Evidence-Aware Reinforcement Learning","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-03T01:57:53.821375Z"},"links":{"cited_paper":"/paper/2506.18254","citing_paper":"/paper/2607.19345"},"observation_digest":"sha256:f6e9ead37c537ae0bcb1e3d8254073809d82ce0ce52a56be7aa29595ead74168","observation_id":"b24dbb89-1a3f-4931-9a84-47e8a977714b","resolution":{"observed_at":"2026-08-03T01:57:53.821375Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.18254","last_updated":"2025-06-23T02:56:36Z","snapshot_observed_at":"2026-08-07T10:52:25.270682Z","submitted_at":"2025-06-23T02:56:36Z","title":"RLPR: Extrapolating RLVR to General Domains without Verifiers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.18254","snapshot_observed_at":"2026-08-01T16:31:11.704541Z","title":"RLPR: Extrapolating RL VR to General Domains without Verifiers","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.22708","last_updated":"2026-07-20T14:14:44Z","snapshot_observed_at":"2026-08-07T12:37:24.746296Z","submitted_at":"2026-07-20T14:14:44Z","title":"StepX-Edge: An On-Device UI Vision-Language Model via Architecture-Training-Deployment Co-Design","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-01T16:31:11.704541Z"},"links":{"cited_paper":"/paper/2506.18254","citing_paper":"/paper/2607.22708"},"observation_digest":"sha256:5760175eca69f02d49004660f9e6b6b1ceed50668161b29a07047923632d7dba","observation_id":"4403b786-7262-4849-adda-33fb400c4398","resolution":{"observed_at":"2026-08-01T16:31:11.704541Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2506.18254/citation-record","integrity":"/paper/2506.18254/integrity","json":"/paper/2506.18254/citation-record.json","paper":"/paper/2506.18254"},"outbound":[],"paper":{"arxiv_id":"2506.18254","last_updated":"2025-06-23T02:56:36Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-07T10:52:25.270682Z","submitted_at":"2025-06-23T02:56:36Z","title":"RLPR: Extrapolating RLVR to General Domains without Verifiers"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"thesis":"As of 14 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 25 inbound Pith citation observations for arXiv:2506.18254."}