{"as_of":"2026-08-13T12:36:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:aa58e266ad0304df2f9a529bcd68afe14fc886a0c28b2d397b4e311c91f52386","coverage":[{"denominator":49,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":49,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T14:53:04.687922Z","state":"measured"},{"denominator":58,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":58,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-13T06:32:02.005865+00:00","state":"measured"},{"denominator":9,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":9,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-08T00:51:25.044392Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T18:30:01.593067Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2507.17512","last_updated":"2025-07-23T13:51:04Z","snapshot_observed_at":"2026-08-09T23:40:29.433863Z","submitted_at":"2025-07-23T13:51:04Z","title":"Can One Domain Help Others? A Data-Centric Study on Multi-Domain Reasoning via Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.17512","snapshot_observed_at":"2026-08-07T14:34:03.334852Z","title":"Can one domain help others? a data-centric study on multi-domain reasoning via reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.18499","last_updated":"2025-08-19T01:33:43Z","snapshot_observed_at":"2026-08-08T19:52:22.300637Z","submitted_at":"2025-05-24T04:33:41Z","title":"G1: Teaching LLMs to Reason on Graphs with Reinforcement Learning","version":3},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T14:34:03.334852Z"},"links":{"cited_paper":"/paper/2507.17512","citing_paper":"/paper/2505.18499"},"observation_digest":"sha256:ecde82c0740a9fe06807d32899b1bd7e5589126b0220160ad865199a3c813027","observation_id":"fd3b1ad9-d1ca-4d57-b2a2-a2d6d004ee21","resolution":{"observed_at":"2026-08-07T14:34:03.334852Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.17512","last_updated":"2025-07-23T13:51:04Z","snapshot_observed_at":"2026-08-09T23:40:29.433863Z","submitted_at":"2025-07-23T13:51:04Z","title":"Can One Domain Help Others? A Data-Centric Study on Multi-Domain Reasoning via Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2507.17512","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.17512","snapshot_observed_at":"2026-07-04T18:30:01.593067Z","title":"Can one domain help others? a data-centric study on multi-domain reason- ing via reinforcement learning","venue":null,"work_id":"6ecd9da5-23cf-4682-8d22-d9f04b89781f","year":2025},"citing_paper":{"arxiv_id":"2603.23964","last_updated":"2026-04-13T08:15:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-03-25T05:56:54Z","title":"From Pixels to Digital Agents: An Empirical Study on the Taxonomy and Technological Trends of Reinforcement Learning Environments","version":2},"reference_index":205,"source":"pdf_text","source_observed_at":"2026-05-15T01:20:03.181903Z"},"links":{"cited_paper":"/paper/2507.17512","citing_paper":"/paper/2603.23964"},"observation_digest":"sha256:8c602373ad9a11f7eab6dce5f71e2f1bb85f862e129865cccce8ffe1e7323bf4","observation_id":"9b320f60-a5de-4d56-91f8-c19802459a26","resolution":{"observed_at":"2026-05-15T01:23:27.214745Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.17512","last_updated":"2025-07-23T13:51:04Z","snapshot_observed_at":"2026-08-09T23:40:29.433863Z","submitted_at":"2025-07-23T13:51:04Z","title":"Can One Domain Help Others? A Data-Centric Study on Multi-Domain Reasoning via Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2507.17512","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.17512","snapshot_observed_at":"2026-07-04T18:30:01.593067Z","title":"Can one domain help others? a data-centric study on multi-domain reason- ing via reinforcement learning","venue":null,"work_id":"6ecd9da5-23cf-4682-8d22-d9f04b89781f","year":2025},"citing_paper":{"arxiv_id":"2604.10480","last_updated":"2026-04-12T06:24:07Z","snapshot_observed_at":"2026-07-06T22:59:05.519456Z","submitted_at":"2026-04-12T06:24:07Z","title":"Tracing the Roots: A Multi-Agent Framework for Uncovering Data Lineage in Post-Training LLMs","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-10T16:14:38.371700Z"},"links":{"cited_paper":"/paper/2507.17512","citing_paper":"/paper/2604.10480"},"observation_digest":"sha256:6823e99dc0bbc9adba2b7cfbbbd95dc5868ca5cc58be0c829c5b3c173085180c","observation_id":"868a42ff-7788-4660-89ec-71efa5ffe279","resolution":{"observed_at":"2026-05-11T09:06:00.589898Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.17512","last_updated":"2025-07-23T13:51:04Z","snapshot_observed_at":"2026-08-09T23:40:29.433863Z","submitted_at":"2025-07-23T13:51:04Z","title":"Can One Domain Help Others? A Data-Centric Study on Multi-Domain Reasoning via Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2507.17512","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.17512","snapshot_observed_at":"2026-07-04T18:30:01.593067Z","title":"Can one domain help others? a data-centric study on multi-domain reason- ing via reinforcement learning","venue":null,"work_id":"6ecd9da5-23cf-4682-8d22-d9f04b89781f","year":2025},"citing_paper":{"arxiv_id":"2606.11052","last_updated":"2026-06-09T16:17:19Z","snapshot_observed_at":"2026-08-05T14:17:36.486236Z","submitted_at":"2026-06-09T16:17:19Z","title":"Attention Amnesia in Hybrid LLMs: When CoT Fine-Tuning Breaks Long-Range Recall, and How to Fix It","version":1},"reference_index":69,"source":"arxiv_source","source_observed_at":"2026-06-27T13:08:57.218711Z"},"links":{"cited_paper":"/paper/2507.17512","citing_paper":"/paper/2606.11052"},"observation_digest":"sha256:d7010ddbf94a3180565290796c96f9659fe90df368d2ecdb3bcdb7e5d5465b57","observation_id":"a0e06f9f-0451-42f5-839a-a005cbc642e2","resolution":{"observed_at":"2026-07-03T05:37:40.383704Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.17512","last_updated":"2025-07-23T13:51:04Z","snapshot_observed_at":"2026-08-09T23:40:29.433863Z","submitted_at":"2025-07-23T13:51:04Z","title":"Can One Domain Help Others? A Data-Centric Study on Multi-Domain Reasoning via Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2507.17512","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.17512","snapshot_observed_at":"2026-07-04T18:30:01.593067Z","title":"Can one domain help others? a data-centric study on multi-domain reason- ing via reinforcement learning","venue":null,"work_id":"6ecd9da5-23cf-4682-8d22-d9f04b89781f","year":2025},"citing_paper":{"arxiv_id":"2606.17682","last_updated":"2026-06-16T08:48:58Z","snapshot_observed_at":"2026-08-12T17:53:55.560408Z","submitted_at":"2026-06-16T08:48:58Z","title":"From Trainee to Trainer: LLM-Designed Training Environment for RL with Multi-Agent Reasoning","version":1},"reference_index":69,"source":"arxiv_source","source_observed_at":"2026-06-27T00:59:50.038405Z"},"links":{"cited_paper":"/paper/2507.17512","citing_paper":"/paper/2606.17682"},"observation_digest":"sha256:a63c7849beaeac9dae64041c0795ca0718c7709198cd5fa42e47acde0ab0f473","observation_id":"580515ac-9341-46d5-9a85-50c4309ae4a5","resolution":{"observed_at":"2026-07-03T20:58:58.333309Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.17512","last_updated":"2025-07-23T13:51:04Z","snapshot_observed_at":"2026-08-09T23:40:29.433863Z","submitted_at":"2025-07-23T13:51:04Z","title":"Can One Domain Help Others? A Data-Centric Study on Multi-Domain Reasoning via Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2507.17512","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.17512","snapshot_observed_at":"2026-07-04T18:30:01.593067Z","title":"Can one domain help others? a data-centric study on multi-domain reason- ing via reinforcement learning","venue":null,"work_id":"6ecd9da5-23cf-4682-8d22-d9f04b89781f","year":2025},"citing_paper":{"arxiv_id":"2606.25178","last_updated":"2026-06-27T02:34:55Z","snapshot_observed_at":"2026-08-10T23:29:37.651575Z","submitted_at":"2026-06-23T21:10:29Z","title":"Transferability for General Reasoning: An Automated Curriculum for Multi-Domain RLVR","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-06-25T22:47:09.330723Z"},"links":{"cited_paper":"/paper/2507.17512","citing_paper":"/paper/2606.25178"},"observation_digest":"sha256:67fd31fe4254be8d184b0bb6dcccfb2d1cc0e9c115f47f48bb66dffa4a382a67","observation_id":"5b202722-a2a8-4412-82fa-adf9ed5d7520","resolution":{"observed_at":"2026-07-04T18:30:01.594743Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.17512","last_updated":"2025-07-23T13:51:04Z","snapshot_observed_at":"2026-08-09T23:40:29.433863Z","submitted_at":"2025-07-23T13:51:04Z","title":"Can One Domain Help Others? A Data-Centric Study on Multi-Domain Reasoning via Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2507.17512","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.17512","snapshot_observed_at":"2026-07-04T18:30:01.593067Z","title":"Can one domain help others? a data-centric study on multi-domain reason- ing via reinforcement learning","venue":null,"work_id":"6ecd9da5-23cf-4682-8d22-d9f04b89781f","year":2025},"citing_paper":{"arxiv_id":"2606.25178","last_updated":"2026-06-27T02:34:55Z","snapshot_observed_at":"2026-08-10T23:29:37.651575Z","submitted_at":"2026-06-23T21:10:29Z","title":"Transferability for General Reasoning: An Automated Curriculum for Multi-Domain RLVR","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-06-30T09:55:19.804589Z"},"links":{"cited_paper":"/paper/2507.17512","citing_paper":"/paper/2606.25178"},"observation_digest":"sha256:c0c3f0c06a5e2f31562291170453862b6d0f5f6185dee70bafd3cbaadc774484","observation_id":"e3968d58-d029-4d7f-a656-7917cb6cc049","resolution":{"observed_at":"2026-06-30T12:54:40.490774Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.17512","last_updated":"2025-07-23T13:51:04Z","snapshot_observed_at":"2026-08-09T23:40:29.433863Z","submitted_at":"2025-07-23T13:51:04Z","title":"Can One Domain Help Others? A Data-Centric Study on Multi-Domain Reasoning via Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.17512","snapshot_observed_at":"2026-08-04T21:54:44.286875Z","title":"arXiv preprint arXiv:2507.17512 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01743","last_updated":"2026-08-03T06:10:33Z","snapshot_observed_at":"2026-08-11T18:00:06.194221Z","submitted_at":"2026-08-03T06:10:33Z","title":"Toward Plasticity-Preserving KL Regularization for Capability Retention in LLM Reinforcement Learning","version":1},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-08-04T21:54:44.286875Z"},"links":{"cited_paper":"/paper/2507.17512","citing_paper":"/paper/2608.01743"},"observation_digest":"sha256:775c43916d1086bf9c6e1fdf716bf19d2c9e826a8f535cffb16aeb54d540f39a","observation_id":"b0b85819-9a32-450d-990c-f7710a6cf889","resolution":{"observed_at":"2026-08-04T21:54:44.286875Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.17512","last_updated":"2025-07-23T13:51:04Z","snapshot_observed_at":"2026-08-09T23:40:29.433863Z","submitted_at":"2025-07-23T13:51:04Z","title":"Can One Domain Help Others? A Data-Centric Study on Multi-Domain Reasoning via Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.17512","snapshot_observed_at":"2026-08-08T00:51:25.044392Z","title":"arXiv preprint arXiv:2507.17512 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03573","last_updated":"2026-08-06T02:48:24Z","snapshot_observed_at":"2026-08-13T08:54:27.373785Z","submitted_at":"2026-08-04T12:32:26Z","title":"SFT Conflicts, RL Coexists: A Theoretical and Empirical Analysis of Multi-Task Learning for LLMs","version":2},"reference_index":71,"source":"arxiv_source","source_observed_at":"2026-08-08T00:51:25.044392Z"},"links":{"cited_paper":"/paper/2507.17512","citing_paper":"/paper/2608.03573"},"observation_digest":"sha256:9f3519fd1180c22c30bcb438a7f30d59b5e479dba7cbc15d5b55f9fbc322bbb4","observation_id":"c2ae80be-b48c-4a30-8693-dbf3e39bd428","resolution":{"observed_at":"2026-08-08T00:51:25.044392Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2507.17512/citation-record","integrity":"/paper/2507.17512/integrity","json":"/paper/2507.17512/citation-record.json","paper":"/paper/2507.17512"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:53:04.403637Z","title":"Program synthesis with large language models, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.17512","last_updated":"2025-07-23T13:51:04Z","snapshot_observed_at":"2026-08-09T23:40:29.433863Z","submitted_at":"2025-07-23T13:51:04Z","title":"Can One Domain Help Others? A Data-Centric Study on Multi-Domain Reasoning via Reinforcement Learning","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T14:53:04.403637Z"},"links":{"citing_paper":"/paper/2507.17512"},"observation_digest":"sha256:40a345260cc635d8139342318b3192331f74a1485252dfadb28ee60c50db7715","observation_id":"8540c431-317c-4b6c-a656-283e69872171","resolution":{"observed_at":"2026-08-06T14:53:04.403637Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:53:06.227739Z","title":"The logic puzzle baron dataset","venue":null,"work_id":"c3dd7b81-b12c-4e03-810f-55488ea5bc2c","year":2024},"citing_paper":{"arxiv_id":"2507.17512","last_updated":"2025-07-23T13:51:04Z","snapshot_observed_at":"2026-08-09T23:40:29.433863Z","submitted_at":"2025-07-23T13:51:04Z","title":"Can One Domain Help Others? A Data-Centric Study on Multi-Domain Reasoning via Reinforcement Learning","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T14:53:04.410008Z"},"links":{"citing_paper":"/paper/2507.17512"},"observation_digest":"sha256:9c79157cc90416749d330b9147e23413ee6a3b5e9e6d696908339f8492bb5cb3","observation_id":"464c56b1-320b-4356-b72a-904b3294ae01","resolution":{"observed_at":"2026-08-06T14:53:06.233755Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.11468","last_updated":"2025-04-10T16:54:05Z","snapshot_observed_at":"2026-08-05T02:57:13.928237Z","submitted_at":"2025-04-10T16:54:05Z","title":"SFT or RL? An Early Investigation into Training R1-Like Reasoning Large Vision-Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.11468","snapshot_observed_at":"2026-08-06T14:53:04.416178Z","title":"Sft or rl? an early investigation into training r1-like reasoning large vision-language models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.17512","last_updated":"2025-07-23T13:51:04Z","snapshot_observed_at":"2026-08-09T23:40:29.433863Z","submitted_at":"2025-07-23T13:51:04Z","title":"Can One Domain Help Others? A Data-Centric Study on Multi-Domain Reasoning via Reinforcement Learning","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T14:53:04.416178Z"},"links":{"cited_paper":"/paper/2504.11468","citing_paper":"/paper/2507.17512"},"observation_digest":"sha256:5b9757ebbb2c3007a67bb631dd9870b3cd9eae39bf4b7c312331eb2c73570c8d","observation_id":"36c4b4ae-a02e-4d87-8706-ad3c159a4e66","resolution":{"observed_at":"2026-08-06T14:53:04.416178Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:53:04.422667Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.17512","last_updated":"2025-07-23T13:51:04Z","snapshot_observed_at":"2026-08-09T23:40:29.433863Z","submitted_at":"2025-07-23T13:51:04Z","title":"Can One Domain Help Others? A Data-Centric Study on Multi-Domain Reasoning via Reinforcement Learning","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T14:53:04.422667Z"},"links":{"citing_paper":"/paper/2507.17512"},"observation_digest":"sha256:1600adb9da4727d034cfeff607bca740edb817e22ef0d76dd9bca28d4316111f","observation_id":"aec1e64f-9f69-469d-95c6-bdf1145e592d","resolution":{"observed_at":"2026-08-06T14:53:04.422667Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:53:04.428206Z","title":"Self-evolving curriculum for llm reasoning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.17512","last_updated":"2025-07-23T13:51:04Z","snapshot_observed_at":"2026-08-09T23:40:29.433863Z","submitted_at":"2025-07-23T13:51:04Z","title":"Can One Domain Help Others? A Data-Centric Study on Multi-Domain Reasoning via Reinforcement Learning","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T14:53:04.428206Z"},"links":{"citing_paper":"/paper/2507.17512"},"observation_digest":"sha256:523a7f486911be94337abc807cea8b3ad54e17a4ea4469577302c3bb85aa5535","observation_id":"50bab17c-3824-428f-bc18-762d56417cda","resolution":{"observed_at":"2026-08-06T14:53:04.428206Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.17161","last_updated":"2025-05-26T17:16:45Z","snapshot_observed_at":"2026-08-09T18:26:12.869738Z","submitted_at":"2025-01-28T18:59:44Z","title":"SFT Memorizes, RL Generalizes: A Comparative Study of Foundation Model Post-training","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.17161","snapshot_observed_at":"2026-08-06T14:53:04.433304Z","title":"Sft memorizes, rl generalizes: A comparative study of foundation model post-training","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.17512","last_updated":"2025-07-23T13:51:04Z","snapshot_observed_at":"2026-08-09T23:40:29.433863Z","submitted_at":"2025-07-23T13:51:04Z","title":"Can One Domain Help Others? A Data-Centric Study on Multi-Domain Reasoning via Reinforcement Learning","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T14:53:04.433304Z"},"links":{"cited_paper":"/paper/2501.17161","citing_paper":"/paper/2507.17512"},"observation_digest":"sha256:baf0d94f0940ef47670eab755be9c653d60890bb9ec5505140fde3937e72a451","observation_id":"b9bdd950-b7f5-4e21-a924-d2cb42fa0ff3","resolution":{"observed_at":"2026-08-06T14:53:04.433304Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:53:04.440151Z","title":"Opencompass: A universal evaluation platform for foundation models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.17512","last_updated":"2025-07-23T13:51:04Z","snapshot_observed_at":"2026-08-09T23:40:29.433863Z","submitted_at":"2025-07-23T13:51:04Z","title":"Can One Domain Help Others? A Data-Centric Study on Multi-Domain Reasoning via Reinforcement Learning","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T14:53:04.440151Z"},"links":{"citing_paper":"/paper/2507.17512"},"observation_digest":"sha256:e5c6c8020d65fc5707ab56fc5706273330d8ce660c71e1a567ead6db9bbfc5db","observation_id":"db7dce01-0a46-45a0-bb37-0a54dfe30f21","resolution":{"observed_at":"2026-08-06T14:53:04.440151Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-08-13T09:12:54.999095Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-06T14:53:04.446447Z","title":"Deepseek-r1: Incentivizing reasoning capability in llms via reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.17512","last_updated":"2025-07-23T13:51:04Z","snapshot_observed_at":"2026-08-09T23:40:29.433863Z","submitted_at":"2025-07-23T13:51:04Z","title":"Can One Domain Help Others? A Data-Centric Study on Multi-Domain Reasoning via Reinforcement Learning","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T14:53:04.446447Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2507.17512"},"observation_digest":"sha256:6c6c491170d7e623741515f3d78bd1321796c410d42be88a288c2f988ecda76f","observation_id":"24e56876-24b6-4871-9f3c-a7b0858efbec","resolution":{"observed_at":"2026-08-06T14:53:04.446447Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.10541","last_updated":"2024-11-15T19:26:38Z","snapshot_observed_at":"2026-08-12T19:33:02.215393Z","submitted_at":"2024-11-15T19:26:38Z","title":"Does Prompt Formatting Have Any Impact on LLM Performance?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.10541","snapshot_observed_at":"2026-08-06T14:53:04.452317Z","title":"Does prompt formatting have any impact on llm performance?, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.17512","last_updated":"2025-07-23T13:51:04Z","snapshot_observed_at":"2026-08-09T23:40:29.433863Z","submitted_at":"2025-07-23T13:51:04Z","title":"Can One Domain Help Others? A Data-Centric Study on Multi-Domain Reasoning via Reinforcement Learning","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T14:53:04.452317Z"},"links":{"cited_paper":"/paper/2411.10541","citing_paper":"/paper/2507.17512"},"observation_digest":"sha256:f8c1116c623d8c22b8ac56ef9cdedbc927b29e57843ddecae10ce1f89cf10975","observation_id":"5e7aed1c-a2a7-43bd-b6f3-d7e3c7508252","resolution":{"observed_at":"2026-08-06T14:53:04.452317Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:53:04.459338Z","title":"Measuring mathematical problem solving with the math dataset","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.17512","last_updated":"2025-07-23T13:51:04Z","snapshot_observed_at":"2026-08-09T23:40:29.433863Z","submitted_at":"2025-07-23T13:51:04Z","title":"Can One Domain Help Others? A Data-Centric Study on Multi-Domain Reasoning via Reinforcement Learning","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T14:53:04.459338Z"},"links":{"citing_paper":"/paper/2507.17512"},"observation_digest":"sha256:ea7d844739e6d2fd229d13f9b9ee12f9244e2fe7f8a14d610392691e4cf4d09d","observation_id":"b9856231-50db-48a3-b3a6-f705f7c8002f","resolution":{"observed_at":"2026-08-06T14:53:04.459338Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.24290","last_updated":"2025-07-05T09:01:04Z","snapshot_observed_at":"2026-08-12T18:49:18.486177Z","submitted_at":"2025-03-31T16:36:05Z","title":"Open-Reasoner-Zero: An Open Source Approach to Scaling Up Reinforcement Learning on the Base Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.24290","snapshot_observed_at":"2026-08-06T14:53:04.466420Z","title":"Open- reasoner-zero: An open source approach to scaling up reinforcement learning on the base model","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.17512","last_updated":"2025-07-23T13:51:04Z","snapshot_observed_at":"2026-08-09T23:40:29.433863Z","submitted_at":"2025-07-23T13:51:04Z","title":"Can One Domain Help Others? A Data-Centric Study on Multi-Domain Reasoning via Reinforcement Learning","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T14:53:04.466420Z"},"links":{"cited_paper":"/paper/2503.24290","citing_paper":"/paper/2507.17512"},"observation_digest":"sha256:d5d1da2c33b0440b574ab8fe362e5553c92d3fb0c75a7f2432c9093f7c94796c","observation_id":"feed8f47-1a9a-4384-a9c7-ed405b8148db","resolution":{"observed_at":"2026-08-06T14:53:04.466420Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:53:06.156540Z","title":"Curricularface: adaptive curriculum learning loss for deep face recognition","venue":null,"work_id":"ee171894-4aba-4160-b693-3d8c05759807","year":2020},"citing_paper":{"arxiv_id":"2507.17512","last_updated":"2025-07-23T13:51:04Z","snapshot_observed_at":"2026-08-09T23:40:29.433863Z","submitted_at":"2025-07-23T13:51:04Z","title":"Can One Domain Help Others? A Data-Centric Study on Multi-Domain Reasoning via Reinforcement Learning","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T14:53:04.472280Z"},"links":{"citing_paper":"/paper/2507.17512"},"observation_digest":"sha256:4a6a8b0dca77ad04b5b22fe09ae2cd44d5243fa1abc1d544ff8787012a94fec2","observation_id":"51949e84-a341-4780-b585-e1b79be1963d","resolution":{"observed_at":"2026-08-06T14:53:06.164700Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.12935","last_updated":"2025-01-07T04:42:20Z","snapshot_observed_at":"2026-08-12T23:41:30.825563Z","submitted_at":"2024-06-17T03:03:34Z","title":"ChatBug: A Common Vulnerability of Aligned LLMs Induced by Chat Templates","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.12935","snapshot_observed_at":"2026-08-06T14:53:04.480460Z","title":"Chatbug: A common vulnerability of aligned llms induced by chat templates, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.17512","last_updated":"2025-07-23T13:51:04Z","snapshot_observed_at":"2026-08-09T23:40:29.433863Z","submitted_at":"2025-07-23T13:51:04Z","title":"Can One Domain Help Others? A Data-Centric Study on Multi-Domain Reasoning via Reinforcement Learning","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T14:53:04.480460Z"},"links":{"cited_paper":"/paper/2406.12935","citing_paper":"/paper/2507.17512"},"observation_digest":"sha256:c41e3f3a5382abde7b091135c83a5a958947c08dceacfda75a38822ec87dc50f","observation_id":"3b5b79ad-7d6a-4e51-b6ee-a8edd4a7b281","resolution":{"observed_at":"2026-08-06T14:53:04.480460Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:53:06.136851Z","title":"Adaptive curriculum learning","venue":null,"work_id":"661e0a56-286b-4713-a67f-bf72c79f8ce3","year":2021},"citing_paper":{"arxiv_id":"2507.17512","last_updated":"2025-07-23T13:51:04Z","snapshot_observed_at":"2026-08-09T23:40:29.433863Z","submitted_at":"2025-07-23T13:51:04Z","title":"Can One Domain Help Others? A Data-Centric Study on Multi-Domain Reasoning via Reinforcement Learning","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T14:53:04.485559Z"},"links":{"citing_paper":"/paper/2507.17512"},"observation_digest":"sha256:e567ee8080d137db75425a8e9f508ad8cb184114cb35727e104df9d2b73be76c","observation_id":"b249235c-fc04-4432-860f-86db0789011f","resolution":{"observed_at":"2026-08-06T14:53:06.142850Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.14852","last_updated":"2023-12-27T10:09:18Z","snapshot_observed_at":"2026-08-13T04:55:06.643740Z","submitted_at":"2023-12-22T17:25:42Z","title":"TACO: Topics in Algorithmic COde generation dataset","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.14852","snapshot_observed_at":"2026-08-06T14:53:04.490769Z","title":"Taco: Topics in algorithmic code generation dataset","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.17512","last_updated":"2025-07-23T13:51:04Z","snapshot_observed_at":"2026-08-09T23:40:29.433863Z","submitted_at":"2025-07-23T13:51:04Z","title":"Can One Domain Help Others? A Data-Centric Study on Multi-Domain Reasoning via Reinforcement Learning","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T14:53:04.490769Z"},"links":{"cited_paper":"/paper/2312.14852","citing_paper":"/paper/2507.17512"},"observation_digest":"sha256:672784f994d58a1a21e6b3588922674443b109903ab89cc61abacd4e55e5afb1","observation_id":"261eacb5-8c18-4f70-be85-b4b4db4152cc","resolution":{"observed_at":"2026-08-06T14:53:04.490769Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.19093","last_updated":"2025-04-27T03:41:17Z","snapshot_observed_at":"2026-08-07T15:58:53.969652Z","submitted_at":"2025-04-27T03:41:17Z","title":"CipherBank: Exploring the Boundary of LLM Reasoning Capabilities through Cryptography Challenges","version":1},"cited_work":{"arxiv_id":"2504.19093","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.19093","snapshot_observed_at":"2026-08-06T14:53:05.616482Z","title":"CipherBank: Exploring the Boundary of LLM Reasoning Capabilities through Cryptography Challenges","venue":"cs.CR","work_id":"707b4bc7-43f0-4149-b1d4-e85e02c52817","year":2025},"citing_paper":{"arxiv_id":"2507.17512","last_updated":"2025-07-23T13:51:04Z","snapshot_observed_at":"2026-08-09T23:40:29.433863Z","submitted_at":"2025-07-23T13:51:04Z","title":"Can One Domain Help Others? A Data-Centric Study on Multi-Domain Reasoning via Reinforcement Learning","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T14:53:04.495978Z"},"links":{"cited_paper":"/paper/2504.19093","citing_paper":"/paper/2507.17512"},"observation_digest":"sha256:78ecc8da7e0f14f706ffa7e269479b759498b2e64bbdca4a6ce7be20fb97ce43","observation_id":"5794391c-270b-4b53-994c-3bcafb3f61d8","resolution":{"observed_at":"2026-08-06T14:53:05.622671Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.01100","last_updated":"2025-07-15T01:14:25Z","snapshot_observed_at":"2026-08-11T01:11:37.606065Z","submitted_at":"2025-02-03T06:44:49Z","title":"ZebraLogic: On the Scaling Limits of LLMs for Logical Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.01100","snapshot_observed_at":"2026-08-06T14:53:04.502280Z","title":"Zebralogic: On the scaling limits of llms for logical reasoning, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.17512","last_updated":"2025-07-23T13:51:04Z","snapshot_observed_at":"2026-08-09T23:40:29.433863Z","submitted_at":"2025-07-23T13:51:04Z","title":"Can One Domain Help Others? A Data-Centric Study on Multi-Domain Reasoning via Reinforcement Learning","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T14:53:04.502280Z"},"links":{"cited_paper":"/paper/2502.01100","citing_paper":"/paper/2507.17512"},"observation_digest":"sha256:81409741515550b37d370cccca72acad85f1f0850cbd9cb40499da49801d128b","observation_id":"0c02e523-1b76-405a-a274-961ce3ec2b8b","resolution":{"observed_at":"2026-08-06T14:53:04.502280Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:53:04.507621Z","title":"Code-r1: Reproducing r1 for code with reliable rewards","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.17512","last_updated":"2025-07-23T13:51:04Z","snapshot_observed_at":"2026-08-09T23:40:29.433863Z","submitted_at":"2025-07-23T13:51:04Z","title":"Can One Domain Help Others? A Data-Centric Study on Multi-Domain Reasoning via Reinforcement Learning","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T14:53:04.507621Z"},"links":{"citing_paper":"/paper/2507.17512"},"observation_digest":"sha256:6d60880cecb1293d03033557c047198cd18ed14d5235628eded55f8b1d7d0c7f","observation_id":"0c83de3e-6965-4c84-83dc-a110bbc069b0","resolution":{"observed_at":"2026-08-06T14:53:04.507621Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.24864","last_updated":"2025-05-30T17:59:01Z","snapshot_observed_at":"2026-08-07T07:17:16.299213Z","submitted_at":"2025-05-30T17:59:01Z","title":"ProRL: Prolonged Reinforcement Learning Expands Reasoning Boundaries in Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.24864","snapshot_observed_at":"2026-08-06T14:53:04.512694Z","title":"Prorl: Prolonged reinforcement learning expands reasoning boundaries in large language models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.17512","last_updated":"2025-07-23T13:51:04Z","snapshot_observed_at":"2026-08-09T23:40:29.433863Z","submitted_at":"2025-07-23T13:51:04Z","title":"Can One Domain Help Others? A Data-Centric Study on Multi-Domain Reasoning via Reinforcement Learning","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T14:53:04.512694Z"},"links":{"cited_paper":"/paper/2505.24864","citing_paper":"/paper/2507.17512"},"observation_digest":"sha256:bbbefbdb94fabc6f8e647f15ea968f82f50cf43d3ece3ea4faff0857b3f575f5","observation_id":"3dd56042-bd00-4b39-9500-092af60b8646","resolution":{"observed_at":"2026-08-06T14:53:04.512694Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20783","last_updated":"2025-10-06T09:30:03Z","snapshot_observed_at":"2026-08-13T12:34:54.476684Z","submitted_at":"2025-03-26T17:59:14Z","title":"Understanding R1-Zero-Like Training: A Critical Perspective","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.20783","snapshot_observed_at":"2026-08-06T14:53:04.518303Z","title":"Understanding r1-zero-like training: A critical perspective","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.17512","last_updated":"2025-07-23T13:51:04Z","snapshot_observed_at":"2026-08-09T23:40:29.433863Z","submitted_at":"2025-07-23T13:51:04Z","title":"Can One Domain Help Others? A Data-Centric Study on Multi-Domain Reasoning via Reinforcement Learning","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T14:53:04.518303Z"},"links":{"cited_paper":"/paper/2503.20783","citing_paper":"/paper/2507.17512"},"observation_digest":"sha256:7e04995cc609f64918dc4c887b42fb5efe6149848e1cea23320cfab97f7daf2a","observation_id":"f4a4d1ef-71e3-4ae2-8d71-3a57ec56a047","resolution":{"observed_at":"2026-08-06T14:53:04.518303Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:53:05.948115Z","title":"Deepscaler: Sur- passing o1-preview with a 1.5b model by scaling rl","venue":null,"work_id":"557f5e36-b53e-4acd-8ce9-058e47582858","year":null},"citing_paper":{"arxiv_id":"2507.17512","last_updated":"2025-07-23T13:51:04Z","snapshot_observed_at":"2026-08-09T23:40:29.433863Z","submitted_at":"2025-07-23T13:51:04Z","title":"Can One Domain Help Others? A Data-Centric Study on Multi-Domain Reasoning via Reinforcement Learning","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T14:53:04.524453Z"},"links":{"citing_paper":"/paper/2507.17512"},"observation_digest":"sha256:7ca90b475f6ee3d0eb51d938f05bc75bcbf0c63fb7a836e4c50991c696f0ec5c","observation_id":"27c200c6-d8f8-460b-9b1f-604d7cd6228f","resolution":{"observed_at":"2026-08-06T14:53:05.956790Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:53:04.529918Z","title":"Tinyzero","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.17512","last_updated":"2025-07-23T13:51:04Z","snapshot_observed_at":"2026-08-09T23:40:29.433863Z","submitted_at":"2025-07-23T13:51:04Z","title":"Can One Domain Help Others? A Data-Centric Study on Multi-Domain Reasoning via Reinforcement Learning","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T14:53:04.529918Z"},"links":{"citing_paper":"/paper/2507.17512"},"observation_digest":"sha256:d13c1c23c566f84bf4ef278ce987261e8316212d49c4e8dff81a0337c6b96fe8","observation_id":"c6d95a42-802e-42a9-9bd9-fdee215ffeaf","resolution":{"observed_at":"2026-08-06T14:53:04.529918Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.17439","last_updated":"2025-05-30T15:19:51Z","snapshot_observed_at":"2026-08-07T16:45:50.800051Z","submitted_at":"2025-03-21T17:59:10Z","title":"LEMMA: Learning from Errors for MatheMatical Advancement in LLMs","version":2},"cited_work":{"arxiv_id":"2503.17439","doi":null,"metadata_source":"pith","pith_arxiv_id":"2503.17439","snapshot_observed_at":"2026-08-06T14:53:05.522601Z","title":"LEMMA: Learning from Errors for MatheMatical Advancement in LLMs","venue":"cs.LG","work_id":"0695bd15-1101-44e4-b2e3-ea9af7b293e5","year":2025},"citing_paper":{"arxiv_id":"2507.17512","last_updated":"2025-07-23T13:51:04Z","snapshot_observed_at":"2026-08-09T23:40:29.433863Z","submitted_at":"2025-07-23T13:51:04Z","title":"Can One Domain Help Others? A Data-Centric Study on Multi-Domain Reasoning via Reinforcement Learning","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T14:53:04.535669Z"},"links":{"cited_paper":"/paper/2503.17439","citing_paper":"/paper/2507.17512"},"observation_digest":"sha256:e9e4fba8c7935dd0490cae7a3827602c1eeedbc017392dba6a09138e917fdb9d","observation_id":"7a590a8f-5024-4596-8016-5eadc3dde457","resolution":{"observed_at":"2026-08-06T14:53:05.531253Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.10541","last_updated":"2025-07-15T06:16:53Z","snapshot_observed_at":"2026-08-09T05:13:41.910639Z","submitted_at":"2025-07-14T17:58:47Z","title":"REST: Stress Testing Large Reasoning Models by Asking Multiple Problems at Once","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.10541","snapshot_observed_at":"2026-08-06T14:53:04.542163Z","title":"Vicky Zhao, Conghui He, and Lijun Wu","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.17512","last_updated":"2025-07-23T13:51:04Z","snapshot_observed_at":"2026-08-09T23:40:29.433863Z","submitted_at":"2025-07-23T13:51:04Z","title":"Can One Domain Help Others? A Data-Centric Study on Multi-Domain Reasoning via Reinforcement Learning","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T14:53:04.542163Z"},"links":{"cited_paper":"/paper/2507.10541","citing_paper":"/paper/2507.17512"},"observation_digest":"sha256:37fe2b8542bdf4efcbee8d7a53a56e72a4d14de0c0624acb2f0f489a4f992d91","observation_id":"b4698c59-ecbb-4409-b14c-54f31f80b53c","resolution":{"observed_at":"2026-08-06T14:53:04.542163Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:53:04.548107Z","title":"Curriculum reinforcement learning from easy to hard tasks improves llm reasoning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.17512","last_updated":"2025-07-23T13:51:04Z","snapshot_observed_at":"2026-08-09T23:40:29.433863Z","submitted_at":"2025-07-23T13:51:04Z","title":"Can One Domain Help Others? A Data-Centric Study on Multi-Domain Reasoning via Reinforcement Learning","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T14:53:04.548107Z"},"links":{"citing_paper":"/paper/2507.17512"},"observation_digest":"sha256:1da90c5b4c5bb3030d40d9c092039763db51a7eda61c8829ab502b1c228ea085","observation_id":"4600ec2e-47c3-431b-93fc-a06241d32518","resolution":{"observed_at":"2026-08-06T14:53:04.548107Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.16212","last_updated":"2025-06-16T05:58:00Z","snapshot_observed_at":"2026-08-12T13:19:10.332127Z","submitted_at":"2025-03-20T15:00:41Z","title":"MathFusion: Enhancing Mathematical Problem-solving of LLM through Instruction Fusion","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.16212","snapshot_observed_at":"2026-08-06T14:53:04.553391Z","title":"Mathfusion: Enhancing mathematical problem-solving of llm through instruction fusion","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.17512","last_updated":"2025-07-23T13:51:04Z","snapshot_observed_at":"2026-08-09T23:40:29.433863Z","submitted_at":"2025-07-23T13:51:04Z","title":"Can One Domain Help Others? A Data-Centric Study on Multi-Domain Reasoning via Reinforcement Learning","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T14:53:04.553391Z"},"links":{"cited_paper":"/paper/2503.16212","citing_paper":"/paper/2507.17512"},"observation_digest":"sha256:1ccce0ffb8f2e625e09e678490ba39932a0c8c5d5cd76dc62f6db594c56c02a0","observation_id":"53c1ef05-4ca3-4a33-b9c0-7412ce87bb1c","resolution":{"observed_at":"2026-08-06T14:53:04.553391Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15115","snapshot_observed_at":"2026-08-06T14:53:04.559294Z","title":"Qwen2.5 technical report, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.17512","last_updated":"2025-07-23T13:51:04Z","snapshot_observed_at":"2026-08-09T23:40:29.433863Z","submitted_at":"2025-07-23T13:51:04Z","title":"Can One Domain Help Others? A Data-Centric Study on Multi-Domain Reasoning via Reinforcement Learning","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T14:53:04.559294Z"},"links":{"cited_paper":"/paper/2412.15115","citing_paper":"/paper/2507.17512"},"observation_digest":"sha256:bad47f3b861753425ee59a018d7464590383b174fdb051ac00e9bb4612043877","observation_id":"077eda26-b9da-431c-8fa9-41f7b564eaea","resolution":{"observed_at":"2026-08-06T14:53:04.559294Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.10910","last_updated":"2025-06-12T17:22:37Z","snapshot_observed_at":"2026-08-08T22:49:29.831091Z","submitted_at":"2025-06-12T17:22:37Z","title":"Magistral","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.10910","snapshot_observed_at":"2026-08-06T14:53:04.564942Z","title":"Magistral","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.17512","last_updated":"2025-07-23T13:51:04Z","snapshot_observed_at":"2026-08-09T23:40:29.433863Z","submitted_at":"2025-07-23T13:51:04Z","title":"Can One Domain Help Others? A Data-Centric Study on Multi-Domain Reasoning via Reinforcement Learning","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T14:53:04.564942Z"},"links":{"cited_paper":"/paper/2506.10910","citing_paper":"/paper/2507.17512"},"observation_digest":"sha256:8dcca1066882600c2ff204fc2766fbf4996989a042e926b21ccb62c827d70e4e","observation_id":"47fa10e6-114b-4b08-b746-7b13c998cd2c","resolution":{"observed_at":"2026-08-06T14:53:04.564942Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-06T14:53:04.570905Z","title":"Proximal policy optimiza- tion algorithms, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.17512","last_updated":"2025-07-23T13:51:04Z","snapshot_observed_at":"2026-08-09T23:40:29.433863Z","submitted_at":"2025-07-23T13:51:04Z","title":"Can One Domain Help Others? A Data-Centric Study on Multi-Domain Reasoning via Reinforcement Learning","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T14:53:04.570905Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2507.17512"},"observation_digest":"sha256:7df12f2c8264c05a343a588f7f024133147771370305dc43e98ef764b91035e7","observation_id":"7957b7bc-3abb-4142-aca0-64e57cae02a1","resolution":{"observed_at":"2026-08-06T14:53:04.570905Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-06T14:53:04.577219Z","title":"Deepseekmath: Pushing the limits of mathematical reasoning in open language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.17512","last_updated":"2025-07-23T13:51:04Z","snapshot_observed_at":"2026-08-09T23:40:29.433863Z","submitted_at":"2025-07-23T13:51:04Z","title":"Can One Domain Help Others? A Data-Centric Study on Multi-Domain Reasoning via Reinforcement Learning","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T14:53:04.577219Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2507.17512"},"observation_digest":"sha256:a81ccd7505bd05306f3ed28074a54f07b7ee6b28a915ecadbde0e257addede2c","observation_id":"e594da3a-4ceb-47cd-ba87-bc49fec21a34","resolution":{"observed_at":"2026-08-06T14:53:04.577219Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.19256","last_updated":"2024-10-02T04:01:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-28T06:20:03Z","title":"HybridFlow: A Flexible and Efficient RLHF Framework","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.19256","snapshot_observed_at":"2026-08-06T14:53:04.582727Z","title":"Hybridflow: A flexible and efficient rlhf framework","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.17512","last_updated":"2025-07-23T13:51:04Z","snapshot_observed_at":"2026-08-09T23:40:29.433863Z","submitted_at":"2025-07-23T13:51:04Z","title":"Can One Domain Help Others? A Data-Centric Study on Multi-Domain Reasoning via Reinforcement Learning","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T14:53:04.582727Z"},"links":{"cited_paper":"/paper/2409.19256","citing_paper":"/paper/2507.17512"},"observation_digest":"sha256:ebffddb637d2f69cbcc932e399eb7ed736e08d12d92f6e2d72dab5104b80a341","observation_id":"d22d86bc-084c-4173-b982-0f7168f298a1","resolution":{"observed_at":"2026-08-06T14:53:04.582727Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:53:05.917080Z","title":"Template matters: Understanding the role of instruction templates in multimodal language model evaluation and training","venue":null,"work_id":"746dbf3f-4ddf-4bd1-917c-da6e47e997e5","year":2025},"citing_paper":{"arxiv_id":"2507.17512","last_updated":"2025-07-23T13:51:04Z","snapshot_observed_at":"2026-08-09T23:40:29.433863Z","submitted_at":"2025-07-23T13:51:04Z","title":"Can One Domain Help Others? A Data-Centric Study on Multi-Domain Reasoning via Reinforcement Learning","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T14:53:04.589065Z"},"links":{"citing_paper":"/paper/2507.17512"},"observation_digest":"sha256:82ccb480bf6bc7707e40dc481c13283bc9f7cfa68e2e1c69c011a9e2a461586f","observation_id":"4997eec7-ee4f-4ac5-9d6e-a3b5f46a16d6","resolution":{"observed_at":"2026-08-06T14:53:05.922540Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:53:04.593968Z","title":"Dump: Automated distribution-level curriculum learning for rl-based llm post-training","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.17512","last_updated":"2025-07-23T13:51:04Z","snapshot_observed_at":"2026-08-09T23:40:29.433863Z","submitted_at":"2025-07-23T13:51:04Z","title":"Can One Domain Help Others? A Data-Centric Study on Multi-Domain Reasoning via Reinforcement Learning","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T14:53:04.593968Z"},"links":{"citing_paper":"/paper/2507.17512"},"observation_digest":"sha256:14def068ed2f932cfb533a7173197ad86b3bc4d22cead53fb27ba3b0dc5f2a95","observation_id":"94f85e59-22da-4291-a53f-247c92d11336","resolution":{"observed_at":"2026-08-06T14:53:04.593968Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.10460","last_updated":"2025-05-28T12:32:29Z","snapshot_observed_at":"2026-08-10T16:59:28.676649Z","submitted_at":"2025-03-13T15:29:22Z","title":"Light-R1: Curriculum SFT, DPO and RL for Long COT from Scratch and Beyond","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.10460","snapshot_observed_at":"2026-08-06T14:53:04.599526Z","title":"Light-r1: Curriculum sft, dpo and rl for long cot from scratch and beyond","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.17512","last_updated":"2025-07-23T13:51:04Z","snapshot_observed_at":"2026-08-09T23:40:29.433863Z","submitted_at":"2025-07-23T13:51:04Z","title":"Can One Domain Help Others? A Data-Centric Study on Multi-Domain Reasoning via Reinforcement Learning","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T14:53:04.599526Z"},"links":{"cited_paper":"/paper/2503.10460","citing_paper":"/paper/2507.17512"},"observation_digest":"sha256:5909597426e29cf11292b8124bd36dc48611edc4e6c896c8d0488062dc6f4d1d","observation_id":"f940d917-eda9-44d6-8168-e3c54efb1326","resolution":{"observed_at":"2026-08-06T14:53:04.599526Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:53:04.605833Z","title":"Rlvr-world: Training world models with reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.17512","last_updated":"2025-07-23T13:51:04Z","snapshot_observed_at":"2026-08-09T23:40:29.433863Z","submitted_at":"2025-07-23T13:51:04Z","title":"Can One Domain Help Others? A Data-Centric Study on Multi-Domain Reasoning via Reinforcement Learning","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T14:53:04.605833Z"},"links":{"citing_paper":"/paper/2507.17512"},"observation_digest":"sha256:31f850db1fd0cbf55610fbf898f6660fd0c5e7399ca13ed16adde3356630ac73","observation_id":"69731711-117f-4cc1-9a86-23b321ce36c5","resolution":{"observed_at":"2026-08-06T14:53:04.605833Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.14655","last_updated":"2025-04-20T15:28:16Z","snapshot_observed_at":"2026-08-10T10:10:21.478473Z","submitted_at":"2025-04-20T15:28:16Z","title":"LeetCodeDataset: A Temporal Dataset for Robust Evaluation and Efficient Training of Code LLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.14655","snapshot_observed_at":"2026-08-06T14:53:04.611175Z","title":"Leetcodedataset: A temporal dataset for robust evaluation and efficient training of code llms, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.17512","last_updated":"2025-07-23T13:51:04Z","snapshot_observed_at":"2026-08-09T23:40:29.433863Z","submitted_at":"2025-07-23T13:51:04Z","title":"Can One Domain Help Others? A Data-Centric Study on Multi-Domain Reasoning via Reinforcement Learning","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T14:53:04.611175Z"},"links":{"cited_paper":"/paper/2504.14655","citing_paper":"/paper/2507.17512"},"observation_digest":"sha256:5abdb0300ef9d65a0d1ee0f3781a5b5d9b51e0af800e3bde1a17ceb63ff24c67","observation_id":"a669a212-d3d2-46c4-8b50-39da3cbb3553","resolution":{"observed_at":"2026-08-06T14:53:04.611175Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.23123","last_updated":"2025-03-04T06:22:40Z","snapshot_observed_at":"2026-08-12T22:11:41.273560Z","submitted_at":"2024-10-30T15:31:54Z","title":"On Memorization of Large Language Models in Logical Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.23123","snapshot_observed_at":"2026-08-06T14:53:04.617685Z","title":"On memorization of large language models in logical reasoning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.17512","last_updated":"2025-07-23T13:51:04Z","snapshot_observed_at":"2026-08-09T23:40:29.433863Z","submitted_at":"2025-07-23T13:51:04Z","title":"Can One Domain Help Others? A Data-Centric Study on Multi-Domain Reasoning via Reinforcement Learning","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T14:53:04.617685Z"},"links":{"cited_paper":"/paper/2410.23123","citing_paper":"/paper/2507.17512"},"observation_digest":"sha256:00ce772dea75da7be02a5dcbd42ea379b389c72dc1a3ec9f6042023eca5d0446","observation_id":"6d631812-2c58-4900-962d-551e04168dad","resolution":{"observed_at":"2026-08-06T14:53:04.617685Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.14768","last_updated":"2025-02-20T17:49:26Z","snapshot_observed_at":"2026-08-04T12:32:53.090165Z","submitted_at":"2025-02-20T17:49:26Z","title":"Logic-RL: Unleashing LLM Reasoning with Rule-Based Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.14768","snapshot_observed_at":"2026-08-06T14:53:04.623265Z","title":"Logic-rl: Unleashing llm reasoning with rule-based reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.17512","last_updated":"2025-07-23T13:51:04Z","snapshot_observed_at":"2026-08-09T23:40:29.433863Z","submitted_at":"2025-07-23T13:51:04Z","title":"Can One Domain Help Others? A Data-Centric Study on Multi-Domain Reasoning via Reinforcement Learning","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T14:53:04.623265Z"},"links":{"cited_paper":"/paper/2502.14768","citing_paper":"/paper/2507.17512"},"observation_digest":"sha256:6896d8de5b21ed164cf9e3ff1bd969b34a905692c6ced1b9a1760f7ce3597f62","observation_id":"4b79c033-5867-4008-8c43-bec4f22f60a7","resolution":{"observed_at":"2026-08-06T14:53:04.623265Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.11284","last_updated":"2025-01-20T05:44:01Z","snapshot_observed_at":"2026-08-10T18:24:10.580633Z","submitted_at":"2025-01-20T05:44:01Z","title":"RedStar: Does Scaling Long-CoT Data Unlock Better Slow-Reasoning Systems?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.11284","snapshot_observed_at":"2026-08-06T14:53:04.629639Z","title":"Redstar: Does scaling long-cot data unlock better slow-reasoning systems? arXiv preprint arXiv:2501.11284, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.17512","last_updated":"2025-07-23T13:51:04Z","snapshot_observed_at":"2026-08-09T23:40:29.433863Z","submitted_at":"2025-07-23T13:51:04Z","title":"Can One Domain Help Others? A Data-Centric Study on Multi-Domain Reasoning via Reinforcement Learning","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T14:53:04.629639Z"},"links":{"cited_paper":"/paper/2501.11284","citing_paper":"/paper/2507.17512"},"observation_digest":"sha256:bd90c9ed6f8c5b6bded3d9450de94f425202a9438e712be3c191c9fd9581925f","observation_id":"b28d8b18-0fdc-4bd4-b0b3-287c237b2b98","resolution":{"observed_at":"2026-08-06T14:53:04.629639Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.10671","last_updated":"2024-09-10T13:25:53Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-07-15T12:35:42Z","title":"Qwen2 Technical Report","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.10671","snapshot_observed_at":"2026-08-06T14:53:04.635611Z","title":"Qwen2 technical report","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.17512","last_updated":"2025-07-23T13:51:04Z","snapshot_observed_at":"2026-08-09T23:40:29.433863Z","submitted_at":"2025-07-23T13:51:04Z","title":"Can One Domain Help Others? A Data-Centric Study on Multi-Domain Reasoning via Reinforcement Learning","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T14:53:04.635611Z"},"links":{"cited_paper":"/paper/2407.10671","citing_paper":"/paper/2507.17512"},"observation_digest":"sha256:00e0b1346f43c023eb0e613ff0da3371e43ac17f8e3330000348533b99cb51b9","observation_id":"63e26268-c21f-4897-a037-d1ba1f9f364a","resolution":{"observed_at":"2026-08-06T14:53:04.635611Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.03373","last_updated":"2025-02-05T17:13:32Z","snapshot_observed_at":"2026-07-06T20:31:41.231839Z","submitted_at":"2025-02-05T17:13:32Z","title":"Demystifying Long Chain-of-Thought Reasoning in LLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.03373","snapshot_observed_at":"2026-08-06T14:53:04.641309Z","title":"Demystifying long chain-of-thought reasoning in llms","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.17512","last_updated":"2025-07-23T13:51:04Z","snapshot_observed_at":"2026-08-09T23:40:29.433863Z","submitted_at":"2025-07-23T13:51:04Z","title":"Can One Domain Help Others? A Data-Centric Study on Multi-Domain Reasoning via Reinforcement Learning","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T14:53:04.641309Z"},"links":{"cited_paper":"/paper/2502.03373","citing_paper":"/paper/2507.17512"},"observation_digest":"sha256:0bea2a77182b4f027cbc0d8a0fc3a1837b861717775f6a402de92158d3df762e","observation_id":"c6b7f1a6-fa47-440d-b4b6-a80fb28074b2","resolution":{"observed_at":"2026-08-06T14:53:04.641309Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.18254","last_updated":"2025-06-23T02:56:36Z","snapshot_observed_at":"2026-08-07T10:52:25.270682Z","submitted_at":"2025-06-23T02:56:36Z","title":"RLPR: Extrapolating RLVR to General Domains without Verifiers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.18254","snapshot_observed_at":"2026-08-06T14:53:04.646543Z","title":"Rlpr: Extrapolating rlvr to general domains without verifiers","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.17512","last_updated":"2025-07-23T13:51:04Z","snapshot_observed_at":"2026-08-09T23:40:29.433863Z","submitted_at":"2025-07-23T13:51:04Z","title":"Can One Domain Help Others? A Data-Centric Study on Multi-Domain Reasoning via Reinforcement Learning","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T14:53:04.646543Z"},"links":{"cited_paper":"/paper/2506.18254","citing_paper":"/paper/2507.17512"},"observation_digest":"sha256:59e49fa89971fd102b5b0380dec581747212807a6565375c8254e2e59534fac4","observation_id":"79755e74-e6e5-458f-b5dd-2e89aacd48ca","resolution":{"observed_at":"2026-08-06T14:53:04.646543Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.15895","last_updated":"2023-10-18T02:07:12Z","snapshot_observed_at":"2026-08-13T11:07:57.598509Z","submitted_at":"2023-06-28T03:31:31Z","title":"Large Language Model as Attributed Training Data Generator: A Tale of Diversity and Bias","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.15895","snapshot_observed_at":"2026-08-06T14:53:04.652198Z","title":"Large language model as attributed training data generator: A tale of diversity and bias, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.17512","last_updated":"2025-07-23T13:51:04Z","snapshot_observed_at":"2026-08-09T23:40:29.433863Z","submitted_at":"2025-07-23T13:51:04Z","title":"Can One Domain Help Others? A Data-Centric Study on Multi-Domain Reasoning via Reinforcement Learning","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T14:53:04.652198Z"},"links":{"cited_paper":"/paper/2306.15895","citing_paper":"/paper/2507.17512"},"observation_digest":"sha256:cba7569585c4c82ebb58425d99ea0d5a8110ec88c526dd9c501dc2524a1674cc","observation_id":"59e5017b-f635-496d-8b23-47ff0b60d0d2","resolution":{"observed_at":"2026-08-06T14:53:04.652198Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.13837","last_updated":"2025-11-24T06:11:04Z","snapshot_observed_at":"2026-07-06T21:11:34.701779Z","submitted_at":"2025-04-18T17:59:56Z","title":"Does Reinforcement Learning Really Incentivize Reasoning Capacity in LLMs Beyond the Base Model?","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.13837","snapshot_observed_at":"2026-08-06T14:53:04.657958Z","title":"Does reinforcement learning really incentivize reasoning capacity in llms beyond the base model? arXiv preprint arXiv:2504.13837, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.17512","last_updated":"2025-07-23T13:51:04Z","snapshot_observed_at":"2026-08-09T23:40:29.433863Z","submitted_at":"2025-07-23T13:51:04Z","title":"Can One Domain Help Others? A Data-Centric Study on Multi-Domain Reasoning via Reinforcement Learning","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-06T14:53:04.657958Z"},"links":{"cited_paper":"/paper/2504.13837","citing_paper":"/paper/2507.17512"},"observation_digest":"sha256:8a6401cc0d7b3dde48fc7f957f535b853dc3af6931f41157bf7875950b518a98","observation_id":"fe1abd00-ca2c-45df-9a78-b2c81c3541b0","resolution":{"observed_at":"2026-08-06T14:53:04.657958Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.18892","last_updated":"2025-08-06T08:42:32Z","snapshot_observed_at":"2026-07-06T20:57:57.039376Z","submitted_at":"2025-03-24T17:06:10Z","title":"SimpleRL-Zoo: Investigating and Taming Zero Reinforcement Learning for Open Base Models in the Wild","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.18892","snapshot_observed_at":"2026-08-06T14:53:04.664420Z","title":"Simplerl-zoo: Investigating and taming zero reinforcement learning for open base models in the wild","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.17512","last_updated":"2025-07-23T13:51:04Z","snapshot_observed_at":"2026-08-09T23:40:29.433863Z","submitted_at":"2025-07-23T13:51:04Z","title":"Can One Domain Help Others? A Data-Centric Study on Multi-Domain Reasoning via Reinforcement Learning","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-06T14:53:04.664420Z"},"links":{"cited_paper":"/paper/2503.18892","citing_paper":"/paper/2507.17512"},"observation_digest":"sha256:0dddf2b7e7f01d54ae4fa4b1150572e09665d9ff6fce13ef2163ff2aad5c8429","observation_id":"1d29a49b-588a-4212-814d-3619556a7145","resolution":{"observed_at":"2026-08-06T14:53:04.664420Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.05132","last_updated":"2025-03-10T01:52:08Z","snapshot_observed_at":"2026-08-11T02:58:52.773885Z","submitted_at":"2025-03-07T04:21:47Z","title":"R1-Zero's \"Aha Moment\" in Visual Reasoning on a 2B Non-SFT Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.05132","snapshot_observed_at":"2026-08-06T14:53:04.670074Z","title":"R1-zero’s” aha moment” in visual reasoning on a 2b non-sft model","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.17512","last_updated":"2025-07-23T13:51:04Z","snapshot_observed_at":"2026-08-09T23:40:29.433863Z","submitted_at":"2025-07-23T13:51:04Z","title":"Can One Domain Help Others? A Data-Centric Study on Multi-Domain Reasoning via Reinforcement Learning","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-06T14:53:04.670074Z"},"links":{"cited_paper":"/paper/2503.05132","citing_paper":"/paper/2507.17512"},"observation_digest":"sha256:18661193af1d487fb1da7754e3088ef2299def4963aa684237169a71ad52ad1e","observation_id":"470444a5-3dd0-47fa-9d4b-5ef8075be893","resolution":{"observed_at":"2026-08-06T14:53:04.670074Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:53:05.899778Z","title":null,"venue":null,"work_id":"9c3952f4-4316-44d6-9cb0-39196928300a","year":null},"citing_paper":{"arxiv_id":"2507.17512","last_updated":"2025-07-23T13:51:04Z","snapshot_observed_at":"2026-08-09T23:40:29.433863Z","submitted_at":"2025-07-23T13:51:04Z","title":"Can One Domain Help Others? A Data-Centric Study on Multi-Domain Reasoning via Reinforcement Learning","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-06T14:53:04.676524Z"},"links":{"citing_paper":"/paper/2507.17512"},"observation_digest":"sha256:81db2670049477f1eb540d62786fe38abb7a05d639933c75bb4904d5a673e662","observation_id":"512ecb7e-3785-48d7-9f99-53c430f3bf9a","resolution":{"observed_at":"2026-08-06T14:53:05.904785Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:53:05.881989Z","title":null,"venue":null,"work_id":"ec4f4f3e-5de6-4ba2-8f18-1c5d242a3e7e","year":null},"citing_paper":{"arxiv_id":"2507.17512","last_updated":"2025-07-23T13:51:04Z","snapshot_observed_at":"2026-08-09T23:40:29.433863Z","submitted_at":"2025-07-23T13:51:04Z","title":"Can One Domain Help Others? A Data-Centric Study on Multi-Domain Reasoning via Reinforcement Learning","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-06T14:53:04.682076Z"},"links":{"citing_paper":"/paper/2507.17512"},"observation_digest":"sha256:0828ec92dbe1d3d128bfb3cb7697f65ad4a3c2bf74128b3a651e6fd3b2eaa0e8","observation_id":"14022813-be9f-4096-be30-4c9619cce5f5","resolution":{"observed_at":"2026-08-06T14:53:05.887391Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:53:05.864744Z","title":"## Answer to the Example Puzzle { ”reasoning”: ”Given Clue 1, we know Peter is in House 2","venue":null,"work_id":"7bfd40ca-a905-4ca6-a5c4-49fa12b16e86","year":null},"citing_paper":{"arxiv_id":"2507.17512","last_updated":"2025-07-23T13:51:04Z","snapshot_observed_at":"2026-08-09T23:40:29.433863Z","submitted_at":"2025-07-23T13:51:04Z","title":"Can One Domain Help Others? A Data-Centric Study on Multi-Domain Reasoning via Reinforcement Learning","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-06T14:53:04.687922Z"},"links":{"citing_paper":"/paper/2507.17512"},"observation_digest":"sha256:80a00cc242ffca0389c73ec3094982b2d457a41ccf9fba345a77d604c554b5b8","observation_id":"95e095bf-ebff-4d3b-96b0-f247b1a9de44","resolution":{"observed_at":"2026-08-06T14:53:05.870440Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2507.17512","last_updated":"2025-07-23T13:51:04Z","latest_version":1,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-09T23:40:29.433863Z","submitted_at":"2025-07-23T13:51:04Z","title":"Can One Domain Help Others? A Data-Centric Study on Multi-Domain Reasoning via Reinforcement Learning"},"reference_resolution":{"displayed":49,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":40,"verified_exact":2,"verified_fuzzy":6},"total_outbound_references":49},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"thesis":"As of 13 August 2026, this Paper Citation Record lists 49 of 49 outbound references and 9 inbound Pith citation observations for arXiv:2507.17512."}