{"as_of":"2026-08-10T17:46:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:c1911cb0b3bde2fb9fd24c81cfec06f96694627a6fe9bd1ada7bf513502ca15f","coverage":[{"denominator":58,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":58,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T00:13:52.537874Z","state":"measured"},{"denominator":71,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":71,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":13,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":13,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-08T00:51:25.047158Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"arxiv_reference","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":0,"observed_at":"2026-08-05T02:28:24.338817Z","source":"arxiv_reference"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.14965","last_updated":"2025-06-17T20:24:00Z","snapshot_observed_at":"2026-08-07T00:07:18.793298Z","submitted_at":"2025-06-17T20:24:00Z","title":"Revisiting Reinforcement Learning for LLM Reasoning from A Cross-Domain Perspective","version":1},"cited_work":{"arxiv_id":"2506.14965","doi":"10.48550/arxiv.2506.14965","metadata_source":"arxiv_reference","pith_arxiv_id":"2506.14965","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Revisiting reinforcement learning for llm reasoning from a cross-domain perspective","venue":"ArXiv.org","work_id":"7d3b6357-5d7a-4eff-8ebf-9033cfbb4eaf","year":2025},"citing_paper":{"arxiv_id":"2503.09567","last_updated":"2025-07-18T15:57:54Z","snapshot_observed_at":"2026-08-08T22:33:20.124926Z","submitted_at":"2025-03-12T17:35:03Z","title":"Towards Reasoning Era: A Survey of Long Chain-of-Thought for Reasoning Large Language Models","version":5},"reference_index":127,"source":"pdf_text","source_observed_at":"2026-05-12T08:40:40.910461Z"},"links":{"cited_paper":"/paper/2506.14965","citing_paper":"/paper/2503.09567"},"observation_digest":"sha256:c2a160a0f9342703a7ca756e9a551e8b2ae13e15a81a01d6aa78b557b5d0a55b","observation_id":"27600c42-52c2-4520-8d41-a13110548b31","resolution":{"observed_at":"2026-05-12T08:40:41.992656Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.14965","last_updated":"2025-06-17T20:24:00Z","snapshot_observed_at":"2026-08-07T00:07:18.793298Z","submitted_at":"2025-06-17T20:24:00Z","title":"Revisiting Reinforcement Learning for LLM Reasoning from A Cross-Domain Perspective","version":1},"cited_work":{"arxiv_id":"2506.14965","doi":"10.48550/arxiv.2506.14965","metadata_source":"arxiv_reference","pith_arxiv_id":"2506.14965","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Revisiting reinforcement learning for llm reasoning from a cross-domain perspective","venue":"ArXiv.org","work_id":"7d3b6357-5d7a-4eff-8ebf-9033cfbb4eaf","year":2025},"citing_paper":{"arxiv_id":"2507.01679","last_updated":"2026-05-15T06:56:26Z","snapshot_observed_at":"2026-08-02T08:39:49.062624Z","submitted_at":"2025-07-02T13:04:09Z","title":"Blending Supervised and Reinforcement Fine-Tuning with Prefix Sampling","version":3},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-05-21T23:39:39.018498Z"},"links":{"cited_paper":"/paper/2506.14965","citing_paper":"/paper/2507.01679"},"observation_digest":"sha256:b84db399b571c5741d36980094b72bc71e2625d08277c7c415390090fd86bd43","observation_id":"23f41cff-96e0-403b-b367-604fc7bac8fc","resolution":{"observed_at":"2026-05-21T23:40:46.468912Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.14965","last_updated":"2025-06-17T20:24:00Z","snapshot_observed_at":"2026-08-07T00:07:18.793298Z","submitted_at":"2025-06-17T20:24:00Z","title":"Revisiting Reinforcement Learning for LLM Reasoning from A Cross-Domain Perspective","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.14965","snapshot_observed_at":"2026-08-05T12:56:35.030001Z","title":"Killian, Mikhail Yurochkin, Zhengzhong Liu, Eric P","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.01142","last_updated":"2025-09-01T05:30:56Z","snapshot_observed_at":"2026-08-08T06:17:53.010186Z","submitted_at":"2025-09-01T05:30:56Z","title":"Dream-Coder 7B: An Open Diffusion Language Model for Code","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-05T12:56:35.030001Z"},"links":{"cited_paper":"/paper/2506.14965","citing_paper":"/paper/2509.01142"},"observation_digest":"sha256:0520bee5b678c0dd8ea989316204e7d1dddb6597094cfe173f51c789c458927b","observation_id":"0e0d3d1c-e15f-453d-833c-25d07c6ef6d7","resolution":{"observed_at":"2026-08-05T12:56:35.030001Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.14965","last_updated":"2025-06-17T20:24:00Z","snapshot_observed_at":"2026-08-07T00:07:18.793298Z","submitted_at":"2025-06-17T20:24:00Z","title":"Revisiting Reinforcement Learning for LLM Reasoning from A Cross-Domain Perspective","version":1},"cited_work":{"arxiv_id":"2506.14965","doi":"10.48550/arxiv.2506.14965","metadata_source":"arxiv_reference","pith_arxiv_id":"2506.14965","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Revisiting reinforcement learning for llm reasoning from a cross-domain perspective","venue":"ArXiv.org","work_id":"7d3b6357-5d7a-4eff-8ebf-9033cfbb4eaf","year":2025},"citing_paper":{"arxiv_id":"2509.08827","last_updated":"2025-10-09T17:08:52Z","snapshot_observed_at":"2026-08-06T15:38:05.011922Z","submitted_at":"2025-09-10T17:59:43Z","title":"A Survey of Reinforcement Learning for Large Reasoning Models","version":3},"reference_index":87,"source":"arxiv_source","source_observed_at":"2026-05-18T00:02:24.352947Z"},"links":{"cited_paper":"/paper/2506.14965","citing_paper":"/paper/2509.08827"},"observation_digest":"sha256:d5230750d027bc56dbf2f9bc09659ce70b714a6f1915bf2b1440b1683353e795","observation_id":"2b3e99fa-9b84-4a9a-b883-cf2046791ad6","resolution":{"observed_at":"2026-05-18T00:02:25.174744Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.14965","last_updated":"2025-06-17T20:24:00Z","snapshot_observed_at":"2026-08-07T00:07:18.793298Z","submitted_at":"2025-06-17T20:24:00Z","title":"Revisiting Reinforcement Learning for LLM Reasoning from A Cross-Domain Perspective","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.14965","snapshot_observed_at":"2026-08-04T16:07:28.561884Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.16679","last_updated":"2025-09-20T13:11:28Z","snapshot_observed_at":"2026-08-04T16:07:24.699834Z","submitted_at":"2025-09-20T13:11:28Z","title":"Reinforcement Learning Meets Large Language Models: A Survey of Advancements and Applications Across the LLM Lifecycle","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-04T16:07:28.561884Z"},"links":{"cited_paper":"/paper/2506.14965","citing_paper":"/paper/2509.16679"},"observation_digest":"sha256:48bc405dfdc8543f1dbc3dd1a136908a3dd5e7f6b4e8a8495e0e7cb845fde04f","observation_id":"0336c218-8eeb-441a-85a1-478bcc30418e","resolution":{"observed_at":"2026-08-04T16:07:28.561884Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.14965","last_updated":"2025-06-17T20:24:00Z","snapshot_observed_at":"2026-08-07T00:07:18.793298Z","submitted_at":"2025-06-17T20:24:00Z","title":"Revisiting Reinforcement Learning for LLM Reasoning from A Cross-Domain Perspective","version":1},"cited_work":{"arxiv_id":"2506.14965","doi":"10.48550/arxiv.2506.14965","metadata_source":"arxiv_reference","pith_arxiv_id":"2506.14965","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Revisiting reinforcement learning for llm reasoning from a cross-domain perspective","venue":"ArXiv.org","work_id":"7d3b6357-5d7a-4eff-8ebf-9033cfbb4eaf","year":2025},"citing_paper":{"arxiv_id":"2604.09748","last_updated":"2026-04-10T09:32:34Z","snapshot_observed_at":"2026-07-06T22:58:34.504325Z","submitted_at":"2026-04-10T09:32:34Z","title":"Backdoors in RLVR: Jailbreak Backdoors in LLMs From Verifiable Reward","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-10T17:46:30.854129Z"},"links":{"cited_paper":"/paper/2506.14965","citing_paper":"/paper/2604.09748"},"observation_digest":"sha256:127f2c203afd909e89c342ee5774b5d81f4c65577f16027e317e8f9551056d8d","observation_id":"ef994c77-03b6-4084-9afe-6a46a4a4c9db","resolution":{"observed_at":"2026-05-11T06:10:59.816045Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.14965","last_updated":"2025-06-17T20:24:00Z","snapshot_observed_at":"2026-08-07T00:07:18.793298Z","submitted_at":"2025-06-17T20:24:00Z","title":"Revisiting Reinforcement Learning for LLM Reasoning from A Cross-Domain Perspective","version":1},"cited_work":{"arxiv_id":"2506.14965","doi":"10.48550/arxiv.2506.14965","metadata_source":"arxiv_reference","pith_arxiv_id":"2506.14965","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Revisiting reinforcement learning for llm reasoning from a cross-domain perspective","venue":"ArXiv.org","work_id":"7d3b6357-5d7a-4eff-8ebf-9033cfbb4eaf","year":2025},"citing_paper":{"arxiv_id":"2606.00609","last_updated":"2026-05-30T08:18:40Z","snapshot_observed_at":"2026-08-08T14:44:48.743716Z","submitted_at":"2026-05-30T08:18:40Z","title":"CARE-RL: Capability-Aware Reinforcement Learning for Mitigating Cross-Domain Conflicts","version":1},"reference_index":72,"source":"arxiv_source","source_observed_at":"2026-06-28T19:01:14.340754Z"},"links":{"cited_paper":"/paper/2506.14965","citing_paper":"/paper/2606.00609"},"observation_digest":"sha256:6addbfd1a761d92e959f1a740248e1c2efb5a4aeb380d4c3d22e3c510d7ca33f","observation_id":"67dcaf45-0935-4531-8b0e-08546f2e69e3","resolution":{"observed_at":"2026-06-28T19:02:34.069072Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.14965","last_updated":"2025-06-17T20:24:00Z","snapshot_observed_at":"2026-08-07T00:07:18.793298Z","submitted_at":"2025-06-17T20:24:00Z","title":"Revisiting Reinforcement Learning for LLM Reasoning from A Cross-Domain Perspective","version":1},"cited_work":{"arxiv_id":"2506.14965","doi":"10.48550/arxiv.2506.14965","metadata_source":"arxiv_reference","pith_arxiv_id":"2506.14965","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Revisiting reinforcement learning for llm reasoning from a cross-domain perspective","venue":"ArXiv.org","work_id":"7d3b6357-5d7a-4eff-8ebf-9033cfbb4eaf","year":2025},"citing_paper":{"arxiv_id":"2606.18089","last_updated":"2026-07-05T17:40:26Z","snapshot_observed_at":"2026-07-12T13:34:39.011240Z","submitted_at":"2026-06-16T15:55:28Z","title":"From Reasoning Traces to Reusable Modules: Understanding Compositional Generalization in Language Model Reasoning","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-06-27T01:13:11.483599Z"},"links":{"cited_paper":"/paper/2506.14965","citing_paper":"/paper/2606.18089"},"observation_digest":"sha256:fc159f6206ed4c7bdb07f7a85b3f825ea8ddd8275113229fa0a8bb6691409ba7","observation_id":"f25aea38-5b2d-48c2-9cec-93deeab9d4c9","resolution":{"observed_at":"2026-06-27T01:20:20.557977Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.14965","last_updated":"2025-06-17T20:24:00Z","snapshot_observed_at":"2026-08-07T00:07:18.793298Z","submitted_at":"2025-06-17T20:24:00Z","title":"Revisiting Reinforcement Learning for LLM Reasoning from A Cross-Domain Perspective","version":1},"cited_work":{"arxiv_id":"2506.14965","doi":"10.48550/arxiv.2506.14965","metadata_source":"arxiv_reference","pith_arxiv_id":"2506.14965","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Revisiting reinforcement learning for llm reasoning from a cross-domain perspective","venue":"ArXiv.org","work_id":"7d3b6357-5d7a-4eff-8ebf-9033cfbb4eaf","year":2025},"citing_paper":{"arxiv_id":"2606.20008","last_updated":"2026-06-18T09:44:12Z","snapshot_observed_at":"2026-07-06T23:55:15.440382Z","submitted_at":"2026-06-18T09:44:12Z","title":"VIMPO: Value-Implicit Policy Optimization for LLMs","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-06-26T17:59:29.066879Z"},"links":{"cited_paper":"/paper/2506.14965","citing_paper":"/paper/2606.20008"},"observation_digest":"sha256:9d6c788ce3aa8edfd255675a6dbd95a301c0a51cabd748abe2a963b6a2ec8d48","observation_id":"93fb66b6-df41-4211-955e-23dc44cf4e4e","resolution":{"observed_at":"2026-07-04T03:29:30.731893Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.14965","last_updated":"2025-06-17T20:24:00Z","snapshot_observed_at":"2026-08-07T00:07:18.793298Z","submitted_at":"2025-06-17T20:24:00Z","title":"Revisiting Reinforcement Learning for LLM Reasoning from A Cross-Domain Perspective","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.14965","snapshot_observed_at":"2026-08-01T21:34:28.015716Z","title":"arXiv preprint arXiv:2506.14965 , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.16051","last_updated":"2026-07-20T15:59:50Z","snapshot_observed_at":"2026-08-09T11:29:07.026465Z","submitted_at":"2026-07-17T15:28:43Z","title":"Loop the Loopies!","version":2},"reference_index":75,"source":"arxiv_source","source_observed_at":"2026-08-01T21:34:28.015716Z"},"links":{"cited_paper":"/paper/2506.14965","citing_paper":"/paper/2607.16051"},"observation_digest":"sha256:faa80e6ef4fd6c7990de1b9abf795fd9bc7a18b30a28258f4bfb00f1aa19cb7c","observation_id":"0b3f1521-154f-4fb4-9be1-f1a318a894d0","resolution":{"observed_at":"2026-08-01T21:34:28.015716Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.14965","last_updated":"2025-06-17T20:24:00Z","snapshot_observed_at":"2026-08-07T00:07:18.793298Z","submitted_at":"2025-06-17T20:24:00Z","title":"Revisiting Reinforcement Learning for LLM Reasoning from A Cross-Domain Perspective","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.14965","snapshot_observed_at":"2026-08-02T14:50:09.878211Z","title":"Killian, Mikhail Yurochkin, Zhengzhong Liu, Eric P","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.16204","last_updated":"2026-05-07T00:40:32Z","snapshot_observed_at":"2026-08-06T07:49:27.049032Z","submitted_at":"2026-05-07T00:40:32Z","title":"Masked Diffusion Language Models are Strong and Steerable Text-Based World Models for Agentic RL","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-02T14:50:09.878211Z"},"links":{"cited_paper":"/paper/2506.14965","citing_paper":"/paper/2607.16204"},"observation_digest":"sha256:595e52c25a0467e07a9e7024ba96e759b5bb675cb802f3b1ba2946a21533e55e","observation_id":"76885f17-4a3b-4958-9ea8-7305911faf1c","resolution":{"observed_at":"2026-08-02T14:50:09.878211Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.14965","last_updated":"2025-06-17T20:24:00Z","snapshot_observed_at":"2026-08-07T00:07:18.793298Z","submitted_at":"2025-06-17T20:24:00Z","title":"Revisiting Reinforcement Learning for LLM Reasoning from A Cross-Domain Perspective","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.14965","snapshot_observed_at":"2026-08-08T00:51:25.047158Z","title":"arXiv preprint arXiv:2506.14965 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03573","last_updated":"2026-08-06T02:48:24Z","snapshot_observed_at":"2026-08-09T23:10:07.427475Z","submitted_at":"2026-08-04T12:32:26Z","title":"SFT Conflicts, RL Coexists: A Theoretical and Empirical Analysis of Multi-Task Learning for LLMs","version":2},"reference_index":72,"source":"arxiv_source","source_observed_at":"2026-08-08T00:51:25.047158Z"},"links":{"cited_paper":"/paper/2506.14965","citing_paper":"/paper/2608.03573"},"observation_digest":"sha256:85ef985be7b9a0272bee2750c17b701ed2dc9485ca8bd47cceaabbd82ed42d57","observation_id":"6ff86dea-41c1-47b1-9ea2-89aaca1fd3c3","resolution":{"observed_at":"2026-08-08T00:51:25.047158Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.14965","last_updated":"2025-06-17T20:24:00Z","snapshot_observed_at":"2026-08-07T00:07:18.793298Z","submitted_at":"2025-06-17T20:24:00Z","title":"Revisiting Reinforcement Learning for LLM Reasoning from A Cross-Domain Perspective","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.14965","snapshot_observed_at":"2026-08-06T04:30:38.938928Z","title":"Killian, Mikhail Yurochkin, Zhengzhong Liu, Eric P","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.05139","last_updated":"2026-08-05T17:57:16Z","snapshot_observed_at":"2026-08-09T12:43:19.697158Z","submitted_at":"2026-08-05T17:57:16Z","title":"Toward Skill-Native LLMs: Skill Entropy for Benchmarking and Training Long-Horizon Reasoning","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T04:30:38.938928Z"},"links":{"cited_paper":"/paper/2506.14965","citing_paper":"/paper/2608.05139"},"observation_digest":"sha256:fdbaf235dbd604e698fe61b8ef98d558dc9638750a40e354db8b13e11cb6919d","observation_id":"e00d57f2-0c17-4e4c-b441-2e87735c546b","resolution":{"observed_at":"2026-08-06T04:30:38.938928Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2506.14965/citation-record","integrity":"/paper/2506.14965/integrity","json":"/paper/2506.14965/citation-record.json","paper":"/paper/2506.14965"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:14:09.089131Z","title":null,"venue":null,"work_id":"d726b844-8d2c-4540-badc-35e14fe46bac","year":null},"citing_paper":{"arxiv_id":"2506.14965","last_updated":"2025-06-17T20:24:00Z","snapshot_observed_at":"2026-08-07T00:07:18.793298Z","submitted_at":"2025-06-17T20:24:00Z","title":"Revisiting Reinforcement Learning for LLM Reasoning from A Cross-Domain Perspective","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T00:13:45.471782Z"},"links":{"citing_paper":"/paper/2506.14965"},"observation_digest":"sha256:4f99b3671629a596c1d8eeabea78ca1d505cc78deddf2c61bd7278b8f77c3c69","observation_id":"3138bf82-e82c-495d-a067-60bd336cd684","resolution":{"observed_at":"2026-08-07T00:14:09.212352Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:14:08.778745Z","title":null,"venue":null,"work_id":"65cda515-f933-4164-b653-e6a39d07ad4a","year":null},"citing_paper":{"arxiv_id":"2506.14965","last_updated":"2025-06-17T20:24:00Z","snapshot_observed_at":"2026-08-07T00:07:18.793298Z","submitted_at":"2025-06-17T20:24:00Z","title":"Revisiting Reinforcement Learning for LLM Reasoning from A Cross-Domain Perspective","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T00:13:45.582726Z"},"links":{"citing_paper":"/paper/2506.14965"},"observation_digest":"sha256:0aa63ddabce1ee88bfc25c5ed57f07431312b33945c571adeae8a677c8528663","observation_id":"83a9bb53-ebd3-4115-8c44-f19668ce2396","resolution":{"observed_at":"2026-08-07T00:14:08.923651Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:14:08.434756Z","title":null,"venue":null,"work_id":"03c3834d-27ef-4d62-8750-71107f622d47","year":null},"citing_paper":{"arxiv_id":"2506.14965","last_updated":"2025-06-17T20:24:00Z","snapshot_observed_at":"2026-08-07T00:07:18.793298Z","submitted_at":"2025-06-17T20:24:00Z","title":"Revisiting Reinforcement Learning for LLM Reasoning from A Cross-Domain Perspective","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T00:13:45.735745Z"},"links":{"citing_paper":"/paper/2506.14965"},"observation_digest":"sha256:794b7c05e2a19b4d19d7fbbad26743173abae6720a6bd096c09e3b34942202c3","observation_id":"71916b87-9b50-4dd0-b789-6164b85fbc6d","resolution":{"observed_at":"2026-08-07T00:14:08.589369Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:14:08.117095Z","title":null,"venue":null,"work_id":"f1ba809e-1592-4ce3-876f-caa18c9b771b","year":null},"citing_paper":{"arxiv_id":"2506.14965","last_updated":"2025-06-17T20:24:00Z","snapshot_observed_at":"2026-08-07T00:07:18.793298Z","submitted_at":"2025-06-17T20:24:00Z","title":"Revisiting Reinforcement Learning for LLM Reasoning from A Cross-Domain Perspective","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T00:13:45.902556Z"},"links":{"citing_paper":"/paper/2506.14965"},"observation_digest":"sha256:29e2fb042d24f1dc551c9a3f1e0e94747e959c362265c7ff4774aa057c1425c5","observation_id":"d0a1db52-a0ad-4743-aede-4cd590b43bed","resolution":{"observed_at":"2026-08-07T00:14:08.285453Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:14:07.806483Z","title":"Then, we need to find m + n","venue":null,"work_id":"ddadaf1b-f1ad-4d3a-8783-d0a47953139a","year":null},"citing_paper":{"arxiv_id":"2506.14965","last_updated":"2025-06-17T20:24:00Z","snapshot_observed_at":"2026-08-07T00:07:18.793298Z","submitted_at":"2025-06-17T20:24:00Z","title":"Revisiting Reinforcement Learning for LLM Reasoning from A Cross-Domain Perspective","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T00:13:46.041924Z"},"links":{"citing_paper":"/paper/2506.14965"},"observation_digest":"sha256:189e77f3ff9fa62e165756e9a98b5bbdd73fd2a7325ef4717fa5a3f8f2d615f0","observation_id":"1fcbdfac-f309-4ad1-ab2e-818520f1635c","resolution":{"observed_at":"2026-08-07T00:14:07.958355Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:14:06.259942Z","title":"It then iterates through each contest, checking if the rating update is allowed based on the division and the current rating","venue":null,"work_id":"e1b0fa1c-8c9c-48da-9ba2-17f11e7188a1","year":1900},"citing_paper":{"arxiv_id":"2506.14965","last_updated":"2025-06-17T20:24:00Z","snapshot_observed_at":"2026-08-07T00:07:18.793298Z","submitted_at":"2025-06-17T20:24:00Z","title":"Revisiting Reinforcement Learning for LLM Reasoning from A Cross-Domain Perspective","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T00:13:46.807880Z"},"links":{"citing_paper":"/paper/2506.14965"},"observation_digest":"sha256:8e3dff8faae1865058933c8fdbcba261ce4c6aea6fe972d248e1d3601d67789a","observation_id":"904a1ea9-7ff3-4a58-b939-a12268677ca3","resolution":{"observed_at":"2026-08-07T00:14:06.357715Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:14:03.371054Z","title":null,"venue":null,"work_id":"ef548dd4-26c9-45e4-81cc-7cb28da1b56f","year":null},"citing_paper":{"arxiv_id":"2506.14965","last_updated":"2025-06-17T20:24:00Z","snapshot_observed_at":"2026-08-07T00:07:18.793298Z","submitted_at":"2025-06-17T20:24:00Z","title":"Revisiting Reinforcement Learning for LLM Reasoning from A Cross-Domain Perspective","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T00:13:47.631692Z"},"links":{"citing_paper":"/paper/2506.14965"},"observation_digest":"sha256:88c7121c7b2de0150b8d0a0d5bf38eeb751dd175334436dbe61a3f21dd65ea2c","observation_id":"606bc65d-bf7f-419a-bd0f-21ad666aa33e","resolution":{"observed_at":"2026-08-07T00:14:03.469653Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:14:07.613632Z","title":null,"venue":null,"work_id":"827a2424-946c-456e-b3e6-a935fc12f7de","year":null},"citing_paper":{"arxiv_id":"2506.14965","last_updated":"2025-06-17T20:24:00Z","snapshot_observed_at":"2026-08-07T00:07:18.793298Z","submitted_at":"2025-06-17T20:24:00Z","title":"Revisiting Reinforcement Learning for LLM Reasoning from A Cross-Domain Perspective","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T00:13:46.164088Z"},"links":{"citing_paper":"/paper/2506.14965"},"observation_digest":"sha256:1eed0e36fc85ae749b47439149a1c5fd4e06e7932a8cfc1c011b43563486e0a9","observation_id":"8bad5977-fa9b-42e4-9682-e70077173bfa","resolution":{"observed_at":"2026-08-07T00:14:07.688839Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:14:07.358104Z","title":"1 and Div","venue":null,"work_id":"296f9cbb-db7a-485d-aecc-e271d78e891c","year":null},"citing_paper":{"arxiv_id":"2506.14965","last_updated":"2025-06-17T20:24:00Z","snapshot_observed_at":"2026-08-07T00:07:18.793298Z","submitted_at":"2025-06-17T20:24:00Z","title":"Revisiting Reinforcement Learning for LLM Reasoning from A Cross-Domain Perspective","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T00:13:46.266434Z"},"links":{"citing_paper":"/paper/2506.14965"},"observation_digest":"sha256:1c5382829af3038d4a24e2a2fe0b37a20bb2b24f4643d1eafbeeb5858ed15346","observation_id":"90db118a-a375-4049-919c-501a5cedd94a","resolution":{"observed_at":"2026-08-07T00:14:07.506687Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:14:07.047662Z","title":null,"venue":null,"work_id":"1ecc6f84-96ab-4942-9579-53e18b4a21de","year":null},"citing_paper":{"arxiv_id":"2506.14965","last_updated":"2025-06-17T20:24:00Z","snapshot_observed_at":"2026-08-07T00:07:18.793298Z","submitted_at":"2025-06-17T20:24:00Z","title":"Revisiting Reinforcement Learning for LLM Reasoning from A Cross-Domain Perspective","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T00:13:46.441684Z"},"links":{"citing_paper":"/paper/2506.14965"},"observation_digest":"sha256:ba12c9ef64c2cad9dd15fe1306c6c890375c0de5e4fbda8b504a1859bf101705","observation_id":"2e9b52ce-7861-462f-8170-1132ff8b69e2","resolution":{"observed_at":"2026-08-07T00:14:07.180762Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:14:06.789985Z","title":null,"venue":null,"work_id":"9a2b1936-8ef5-4213-a21f-7790c6476682","year":null},"citing_paper":{"arxiv_id":"2506.14965","last_updated":"2025-06-17T20:24:00Z","snapshot_observed_at":"2026-08-07T00:07:18.793298Z","submitted_at":"2025-06-17T20:24:00Z","title":"Revisiting Reinforcement Learning for LLM Reasoning from A Cross-Domain Perspective","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T00:13:46.558733Z"},"links":{"citing_paper":"/paper/2506.14965"},"observation_digest":"sha256:130bd430f2d6920480801c05ac706c855ffe373fc7e651adc777ab3a14ae49d3","observation_id":"3bd8f8df-6715-49d8-836e-75d60fa87122","resolution":{"observed_at":"2026-08-07T00:14:06.899841Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:14:06.494634Z","title":null,"venue":null,"work_id":"ff167274-7bc1-48a7-bd8b-3b98cbbfc61f","year":null},"citing_paper":{"arxiv_id":"2506.14965","last_updated":"2025-06-17T20:24:00Z","snapshot_observed_at":"2026-08-07T00:07:18.793298Z","submitted_at":"2025-06-17T20:24:00Z","title":"Revisiting Reinforcement Learning for LLM Reasoning from A Cross-Domain Perspective","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T00:13:46.683555Z"},"links":{"citing_paper":"/paper/2506.14965"},"observation_digest":"sha256:0e314366be5eb5e3e5badcac37a802555b7072190d0b6f3412833dc72e070ef4","observation_id":"4c39eab6-36d7-423b-93b8-3d96b128a135","resolution":{"observed_at":"2026-08-07T00:14:06.651073Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:14:01.029758Z","title":"Let’s re-evaluate the steps to ensure accuracy","venue":null,"work_id":"ab3841e2-cfb5-4997-96d8-e2672c63be0a","year":null},"citing_paper":{"arxiv_id":"2506.14965","last_updated":"2025-06-17T20:24:00Z","snapshot_observed_at":"2026-08-07T00:07:18.793298Z","submitted_at":"2025-06-17T20:24:00Z","title":"Revisiting Reinforcement Learning for LLM Reasoning from A Cross-Domain Perspective","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T00:13:48.278736Z"},"links":{"citing_paper":"/paper/2506.14965"},"observation_digest":"sha256:9d6d1064dc0acb31756dd144d23f1ba091b0cf9737f984c9b6e1543f94d255aa","observation_id":"d5a7bc77-65b7-449c-8445-e1bba119cd06","resolution":{"observed_at":"2026-08-07T00:14:01.138253Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:14:05.989939Z","title":null,"venue":null,"work_id":"f552b13b-f2b0-43b6-85ef-d91da3003a54","year":null},"citing_paper":{"arxiv_id":"2506.14965","last_updated":"2025-06-17T20:24:00Z","snapshot_observed_at":"2026-08-07T00:07:18.793298Z","submitted_at":"2025-06-17T20:24:00Z","title":"Revisiting Reinforcement Learning for LLM Reasoning from A Cross-Domain Perspective","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T00:13:46.940775Z"},"links":{"citing_paper":"/paper/2506.14965"},"observation_digest":"sha256:e8e83ffe3468eda9c9296f2403736839ad1229998b55c26e60800b94f74066c0","observation_id":"561eaa2d-27b8-4cd3-90e8-069caecd54e0","resolution":{"observed_at":"2026-08-07T00:14:06.110374Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:14:04.907965Z","title":null,"venue":null,"work_id":"a29d10cd-b751-4785-8569-5902ca97b469","year":null},"citing_paper":{"arxiv_id":"2506.14965","last_updated":"2025-06-17T20:24:00Z","snapshot_observed_at":"2026-08-07T00:07:18.793298Z","submitted_at":"2025-06-17T20:24:00Z","title":"Revisiting Reinforcement Learning for LLM Reasoning from A Cross-Domain Perspective","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T00:13:47.053183Z"},"links":{"citing_paper":"/paper/2506.14965"},"observation_digest":"sha256:1410639735c7403ec5115e0761435219a7c8fad46bebcf7004ff450b42b68ebe","observation_id":"e5b81542-0dc0-42a4-9aff-88dcc6d10f33","resolution":{"observed_at":"2026-08-07T00:14:05.509203Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:14:04.601716Z","title":null,"venue":null,"work_id":"9f5fed93-8ebd-4f1c-a4a0-4b4f05c3f660","year":null},"citing_paper":{"arxiv_id":"2506.14965","last_updated":"2025-06-17T20:24:00Z","snapshot_observed_at":"2026-08-07T00:07:18.793298Z","submitted_at":"2025-06-17T20:24:00Z","title":"Revisiting Reinforcement Learning for LLM Reasoning from A Cross-Domain Perspective","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T00:13:47.150869Z"},"links":{"citing_paper":"/paper/2506.14965"},"observation_digest":"sha256:edec4ff05552bb7987633f9af1bc275c6ff86b98c2ee73927fb201df5bc6465a","observation_id":"b8d5dc60-c242-4513-8d50-64d8f780a078","resolution":{"observed_at":"2026-08-07T00:14:04.758704Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:14:04.333432Z","title":null,"venue":null,"work_id":"e19f2b7d-4685-454a-9215-e695c4349070","year":null},"citing_paper":{"arxiv_id":"2506.14965","last_updated":"2025-06-17T20:24:00Z","snapshot_observed_at":"2026-08-07T00:07:18.793298Z","submitted_at":"2025-06-17T20:24:00Z","title":"Revisiting Reinforcement Learning for LLM Reasoning from A Cross-Domain Perspective","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T00:13:47.281545Z"},"links":{"citing_paper":"/paper/2506.14965"},"observation_digest":"sha256:4c22cb13c6f66a5de48dffd61c4351fee54c0dd23a6bdf7355eddfa5d5f3e606","observation_id":"d308de17-9e8f-45b7-826b-a31712440022","resolution":{"observed_at":"2026-08-07T00:14:04.473637Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:14:03.924892Z","title":null,"venue":null,"work_id":"8f9ee06a-036d-4e7e-804e-19d88bf29204","year":null},"citing_paper":{"arxiv_id":"2506.14965","last_updated":"2025-06-17T20:24:00Z","snapshot_observed_at":"2026-08-07T00:07:18.793298Z","submitted_at":"2025-06-17T20:24:00Z","title":"Revisiting Reinforcement Learning for LLM Reasoning from A Cross-Domain Perspective","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T00:13:47.394921Z"},"links":{"citing_paper":"/paper/2506.14965"},"observation_digest":"sha256:4f6e8a04ce2f8a8dccaa3e368643d542ca46b5b7b68b6e45237982c599c60035","observation_id":"f5b18e92-3841-46a3-9fb1-638b46c2bfd6","resolution":{"observed_at":"2026-08-07T00:14:04.118712Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:14:03.610226Z","title":null,"venue":null,"work_id":"2fced8aa-5182-4ec6-b52f-2bad101db8d3","year":null},"citing_paper":{"arxiv_id":"2506.14965","last_updated":"2025-06-17T20:24:00Z","snapshot_observed_at":"2026-08-07T00:07:18.793298Z","submitted_at":"2025-06-17T20:24:00Z","title":"Revisiting Reinforcement Learning for LLM Reasoning from A Cross-Domain Perspective","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T00:13:47.497750Z"},"links":{"citing_paper":"/paper/2506.14965"},"observation_digest":"sha256:ad0b0098558015204654e127d354b10d8342cb48ef8abaf887ac9db827c2e8ae","observation_id":"ccf1fad5-58cd-4759-ac53-005dc8641e56","resolution":{"observed_at":"2026-08-07T00:14:03.767662Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:14:03.091047Z","title":null,"venue":null,"work_id":"db6f5b89-3248-4b8e-9972-24279977c876","year":null},"citing_paper":{"arxiv_id":"2506.14965","last_updated":"2025-06-17T20:24:00Z","snapshot_observed_at":"2026-08-07T00:07:18.793298Z","submitted_at":"2025-06-17T20:24:00Z","title":"Revisiting Reinforcement Learning for LLM Reasoning from A Cross-Domain Perspective","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T00:13:47.779040Z"},"links":{"citing_paper":"/paper/2506.14965"},"observation_digest":"sha256:19289d4707b42a989b4011f5e99470b65355426d6969f77fe4a18c06a6e6b3ec","observation_id":"79c8865c-3eb0-4ba2-88e1-675fa05812a8","resolution":{"observed_at":"2026-08-07T00:14:03.237728Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:14:02.759562Z","title":null,"venue":null,"work_id":"7d9e041e-3504-4a79-bbbf-0414345f17dd","year":null},"citing_paper":{"arxiv_id":"2506.14965","last_updated":"2025-06-17T20:24:00Z","snapshot_observed_at":"2026-08-07T00:07:18.793298Z","submitted_at":"2025-06-17T20:24:00Z","title":"Revisiting Reinforcement Learning for LLM Reasoning from A Cross-Domain Perspective","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T00:13:47.849093Z"},"links":{"citing_paper":"/paper/2506.14965"},"observation_digest":"sha256:24789779f87ce4bc4c9fcd06e20cc857b15cc4b509a64d16b217c551d043996c","observation_id":"2df6be70-039f-445e-8351-8395f955c2b1","resolution":{"observed_at":"2026-08-07T00:14:02.939028Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:14:02.619098Z","title":null,"venue":null,"work_id":"9c62663f-2d43-4f6c-99d2-90ec91a8b7b0","year":1900},"citing_paper":{"arxiv_id":"2506.14965","last_updated":"2025-06-17T20:24:00Z","snapshot_observed_at":"2026-08-07T00:07:18.793298Z","submitted_at":"2025-06-17T20:24:00Z","title":"Revisiting Reinforcement Learning for LLM Reasoning from A Cross-Domain Perspective","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T00:13:47.916450Z"},"links":{"citing_paper":"/paper/2506.14965"},"observation_digest":"sha256:426b9950233dd39a85c6ef71c52b2c6b23ee99c267eeb8f2595394660ef8258c","observation_id":"8c2d2e3d-62a6-40d2-ae85-dcae07540fbc","resolution":{"observed_at":"2026-08-07T00:14:02.685215Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:14:02.341768Z","title":null,"venue":null,"work_id":"10b0f270-7a69-4715-879d-6a61d81fa257","year":null},"citing_paper":{"arxiv_id":"2506.14965","last_updated":"2025-06-17T20:24:00Z","snapshot_observed_at":"2026-08-07T00:07:18.793298Z","submitted_at":"2025-06-17T20:24:00Z","title":"Revisiting Reinforcement Learning for LLM Reasoning from A Cross-Domain Perspective","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T00:13:48.010638Z"},"links":{"citing_paper":"/paper/2506.14965"},"observation_digest":"sha256:d0b4ceb84c5752add191c95b9adc87277776a40b575511a2ff7f7a5689dcb4e4","observation_id":"34521ad9-4368-4240-a31d-5f3518465ab0","resolution":{"observed_at":"2026-08-07T00:14:02.531780Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:14:01.281193Z","title":null,"venue":null,"work_id":"83ab3d9d-3fb0-4f6a-84b0-6b69a8dca4a3","year":null},"citing_paper":{"arxiv_id":"2506.14965","last_updated":"2025-06-17T20:24:00Z","snapshot_observed_at":"2026-08-07T00:07:18.793298Z","submitted_at":"2025-06-17T20:24:00Z","title":"Revisiting Reinforcement Learning for LLM Reasoning from A Cross-Domain Perspective","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T00:13:48.158982Z"},"links":{"citing_paper":"/paper/2506.14965"},"observation_digest":"sha256:c031ee36226fb174b42d93a1a30afa00c5d3c4f4567b6d12d5481874739fbb2a","observation_id":"44c0796f-5a42-4105-9e5e-207ea3a16213","resolution":{"observed_at":"2026-08-07T00:14:01.409899Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:14:00.767495Z","title":null,"venue":null,"work_id":"e616dec0-0b61-403b-92bd-d82b8e9f9539","year":null},"citing_paper":{"arxiv_id":"2506.14965","last_updated":"2025-06-17T20:24:00Z","snapshot_observed_at":"2026-08-07T00:07:18.793298Z","submitted_at":"2025-06-17T20:24:00Z","title":"Revisiting Reinforcement Learning for LLM Reasoning from A Cross-Domain Perspective","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T00:13:48.362317Z"},"links":{"citing_paper":"/paper/2506.14965"},"observation_digest":"sha256:8f637aa7ff0ae3e3992c101dfe963437cb6bedbf7350f8f80f407ea6a7b165e0","observation_id":"c8b8d9f8-62a7-46fb-b45b-320123b70775","resolution":{"observed_at":"2026-08-07T00:14:00.891058Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:14:00.512621Z","title":"Your task is to analyze puzzles, spot patterns, and provide direct solutions","venue":null,"work_id":"1e9abf48-b5ef-4901-bf12-621de39b00be","year":null},"citing_paper":{"arxiv_id":"2506.14965","last_updated":"2025-06-17T20:24:00Z","snapshot_observed_at":"2026-08-07T00:07:18.793298Z","submitted_at":"2025-06-17T20:24:00Z","title":"Revisiting Reinforcement Learning for LLM Reasoning from A Cross-Domain Perspective","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T00:13:48.511657Z"},"links":{"citing_paper":"/paper/2506.14965"},"observation_digest":"sha256:b96d6e1dfa256e8654ccf7406f1c0acd5840964f84fda7cad48932f300b859a2","observation_id":"9ceceaa9-03e0-4f6a-b932-678bdb381182","resolution":{"observed_at":"2026-08-07T00:14:00.629978Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:14:00.311277Z","title":null,"venue":null,"work_id":"1c736218-82c4-43fe-8dfe-970575b4d80e","year":null},"citing_paper":{"arxiv_id":"2506.14965","last_updated":"2025-06-17T20:24:00Z","snapshot_observed_at":"2026-08-07T00:07:18.793298Z","submitted_at":"2025-06-17T20:24:00Z","title":"Revisiting Reinforcement Learning for LLM Reasoning from A Cross-Domain Perspective","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T00:13:48.651745Z"},"links":{"citing_paper":"/paper/2506.14965"},"observation_digest":"sha256:1d2f67358e2afeff869c02adcacd78cd40dc1221151cc2ce88c519d414ab09fb","observation_id":"d8d9ba3b-30a0-497e-9c0c-c1e794a98bfc","resolution":{"observed_at":"2026-08-07T00:14:00.417362Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:14:00.074117Z","title":null,"venue":null,"work_id":"ff195ec9-6b06-4ed9-ad08-0c0fef17cfd9","year":null},"citing_paper":{"arxiv_id":"2506.14965","last_updated":"2025-06-17T20:24:00Z","snapshot_observed_at":"2026-08-07T00:07:18.793298Z","submitted_at":"2025-06-17T20:24:00Z","title":"Revisiting Reinforcement Learning for LLM Reasoning from A Cross-Domain Perspective","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T00:13:48.801229Z"},"links":{"citing_paper":"/paper/2506.14965"},"observation_digest":"sha256:7d2df04e4e637da7dc89cd88bc5ab11b7a6462a86ef43987a282fd19cabf15fe","observation_id":"13623a4e-18eb-42b3-b338-6baf05f91d48","resolution":{"observed_at":"2026-08-07T00:14:00.185666Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:13:59.804404Z","title":null,"venue":null,"work_id":"8d40e1a6-28f6-4289-b7b7-44ebc353c18e","year":null},"citing_paper":{"arxiv_id":"2506.14965","last_updated":"2025-06-17T20:24:00Z","snapshot_observed_at":"2026-08-07T00:07:18.793298Z","submitted_at":"2025-06-17T20:24:00Z","title":"Revisiting Reinforcement Learning for LLM Reasoning from A Cross-Domain Perspective","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T00:13:48.962428Z"},"links":{"citing_paper":"/paper/2506.14965"},"observation_digest":"sha256:e0e631bdc7022b4fe50498399884b56561400ba9249a5f2498d8fb3eeb3fa5ab","observation_id":"dfea3190-e89e-4293-92e9-24e51bbe27de","resolution":{"observed_at":"2026-08-07T00:13:59.962503Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:13:59.564976Z","title":null,"venue":null,"work_id":"80785f0a-ff65-4eb3-b834-859f081b1a00","year":null},"citing_paper":{"arxiv_id":"2506.14965","last_updated":"2025-06-17T20:24:00Z","snapshot_observed_at":"2026-08-07T00:07:18.793298Z","submitted_at":"2025-06-17T20:24:00Z","title":"Revisiting Reinforcement Learning for LLM Reasoning from A Cross-Domain Perspective","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T00:13:49.110531Z"},"links":{"citing_paper":"/paper/2506.14965"},"observation_digest":"sha256:d8aadfbd4d6a20051abe9e100528608834fa6b1626a311329a38c050c2bdb98b","observation_id":"33c17e1c-ce9d-45fb-8a53-b9cb09664b21","resolution":{"observed_at":"2026-08-07T00:13:59.677211Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:13:59.322015Z","title":null,"venue":null,"work_id":"360a01e3-7b65-4180-92c4-21156607e705","year":null},"citing_paper":{"arxiv_id":"2506.14965","last_updated":"2025-06-17T20:24:00Z","snapshot_observed_at":"2026-08-07T00:07:18.793298Z","submitted_at":"2025-06-17T20:24:00Z","title":"Revisiting Reinforcement Learning for LLM Reasoning from A Cross-Domain Perspective","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T00:13:49.214779Z"},"links":{"citing_paper":"/paper/2506.14965"},"observation_digest":"sha256:1a7409af8dda59fd69b3159b9e13b81668b1257fd8a8350e589742e012443614","observation_id":"4b86bc8f-0d19-4976-b28f-5a63ca37dcc6","resolution":{"observed_at":"2026-08-07T00:13:59.435392Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:13:59.049454Z","title":null,"venue":null,"work_id":"79ec7a95-1ba0-47d4-b858-19f11176517a","year":null},"citing_paper":{"arxiv_id":"2506.14965","last_updated":"2025-06-17T20:24:00Z","snapshot_observed_at":"2026-08-07T00:07:18.793298Z","submitted_at":"2025-06-17T20:24:00Z","title":"Revisiting Reinforcement Learning for LLM Reasoning from A Cross-Domain Perspective","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T00:13:49.351833Z"},"links":{"citing_paper":"/paper/2506.14965"},"observation_digest":"sha256:1eb38136aa1bdd3e6d87cccdcca474de8713b0f5d455e1059da9165880baa4cc","observation_id":"c2431a87-37bf-480e-a23a-7bc492c49acd","resolution":{"observed_at":"2026-08-07T00:13:59.138179Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:13:58.776918Z","title":null,"venue":null,"work_id":"a4481e15-4028-4f8d-984f-749c22ca16db","year":null},"citing_paper":{"arxiv_id":"2506.14965","last_updated":"2025-06-17T20:24:00Z","snapshot_observed_at":"2026-08-07T00:07:18.793298Z","submitted_at":"2025-06-17T20:24:00Z","title":"Revisiting Reinforcement Learning for LLM Reasoning from A Cross-Domain Perspective","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T00:13:49.481090Z"},"links":{"citing_paper":"/paper/2506.14965"},"observation_digest":"sha256:0f65b8662f736e3c9fe09e3432a59170e8c78adea9a5859be0c41d694bda1894","observation_id":"17b7b37a-ebb1-4681-987c-e4ecc4bc640e","resolution":{"observed_at":"2026-08-07T00:13:58.882899Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:13:58.457417Z","title":null,"venue":null,"work_id":"ee7c61cf-af31-4a5f-972d-a3e85c175aad","year":null},"citing_paper":{"arxiv_id":"2506.14965","last_updated":"2025-06-17T20:24:00Z","snapshot_observed_at":"2026-08-07T00:07:18.793298Z","submitted_at":"2025-06-17T20:24:00Z","title":"Revisiting Reinforcement Learning for LLM Reasoning from A Cross-Domain Perspective","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T00:13:49.599814Z"},"links":{"citing_paper":"/paper/2506.14965"},"observation_digest":"sha256:c55e124d68f3d3fa37b91d7c5c05b8414101030a7d26cf8e645abc0117563b3f","observation_id":"bc407327-b6b3-475e-ba27-073ddf48cbcf","resolution":{"observed_at":"2026-08-07T00:13:58.611425Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:13:58.222649Z","title":"p u b l i c _ k e y","venue":null,"work_id":"38bcdfe8-0e66-48bd-8c4c-0a179479d300","year":null},"citing_paper":{"arxiv_id":"2506.14965","last_updated":"2025-06-17T20:24:00Z","snapshot_observed_at":"2026-08-07T00:07:18.793298Z","submitted_at":"2025-06-17T20:24:00Z","title":"Revisiting Reinforcement Learning for LLM Reasoning from A Cross-Domain Perspective","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T00:13:49.774594Z"},"links":{"citing_paper":"/paper/2506.14965"},"observation_digest":"sha256:3132c99a2de6211394a14e2ac4375c5587db4b11e70f546133358b974aec770e","observation_id":"e6204e8e-b5f1-4d90-af83-7d1015add0bf","resolution":{"observed_at":"2026-08-07T00:13:58.326281Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:13:57.899633Z","title":null,"venue":null,"work_id":"5d4718a6-0f74-406f-b96b-9911ebf632d8","year":null},"citing_paper":{"arxiv_id":"2506.14965","last_updated":"2025-06-17T20:24:00Z","snapshot_observed_at":"2026-08-07T00:07:18.793298Z","submitted_at":"2025-06-17T20:24:00Z","title":"Revisiting Reinforcement Learning for LLM Reasoning from A Cross-Domain Perspective","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T00:13:49.906248Z"},"links":{"citing_paper":"/paper/2506.14965"},"observation_digest":"sha256:194913fd1954bf2a2e3498d2dca3bc2f630af55a6131fbf94513a7b1eb8a5163","observation_id":"31d903f8-0fa2-4c32-a3cf-612d280e13e5","resolution":{"observed_at":"2026-08-07T00:13:58.046485Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:13:57.618382Z","title":null,"venue":null,"work_id":"ace7602d-691c-44a2-bf2e-c6d499c4271a","year":null},"citing_paper":{"arxiv_id":"2506.14965","last_updated":"2025-06-17T20:24:00Z","snapshot_observed_at":"2026-08-07T00:07:18.793298Z","submitted_at":"2025-06-17T20:24:00Z","title":"Revisiting Reinforcement Learning for LLM Reasoning from A Cross-Domain Perspective","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T00:13:50.085910Z"},"links":{"citing_paper":"/paper/2506.14965"},"observation_digest":"sha256:441d48cfebfd551fbd97fbac3934bfb0befd49bd4f228631bbff5022317985ba","observation_id":"9ff46a1f-bb33-4f72-ba58-af439a0d7337","resolution":{"observed_at":"2026-08-07T00:13:57.795625Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:13:57.401333Z","title":null,"venue":null,"work_id":"1b92f791-dbdc-476c-8469-bf3a1d093478","year":null},"citing_paper":{"arxiv_id":"2506.14965","last_updated":"2025-06-17T20:24:00Z","snapshot_observed_at":"2026-08-07T00:07:18.793298Z","submitted_at":"2025-06-17T20:24:00Z","title":"Revisiting Reinforcement Learning for LLM Reasoning from A Cross-Domain Perspective","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T00:13:50.210072Z"},"links":{"citing_paper":"/paper/2506.14965"},"observation_digest":"sha256:5e0fb08d0be4dde1e8ad2dd2308d37d670bb984405d6d52311fdd1ac861efd3f","observation_id":"54cf4116-2865-4cde-a7f6-343a9a6b0fd7","resolution":{"observed_at":"2026-08-07T00:13:57.490070Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:13:57.178480Z","title":null,"venue":null,"work_id":"2a22fa07-73cc-4478-839c-fe75217bbbf1","year":null},"citing_paper":{"arxiv_id":"2506.14965","last_updated":"2025-06-17T20:24:00Z","snapshot_observed_at":"2026-08-07T00:07:18.793298Z","submitted_at":"2025-06-17T20:24:00Z","title":"Revisiting Reinforcement Learning for LLM Reasoning from A Cross-Domain Perspective","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T00:13:50.365980Z"},"links":{"citing_paper":"/paper/2506.14965"},"observation_digest":"sha256:92b51666e606966e8ae3c150138423c7db1a9f6a0abd0b92c52054c3c9cfffbf","observation_id":"2dcc7f77-1bb7-43a9-871d-083c1146bc3a","resolution":{"observed_at":"2026-08-07T00:13:57.301531Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:13:56.983096Z","title":null,"venue":null,"work_id":"30496e2b-dd61-4338-be40-ad377bcbe9cd","year":null},"citing_paper":{"arxiv_id":"2506.14965","last_updated":"2025-06-17T20:24:00Z","snapshot_observed_at":"2026-08-07T00:07:18.793298Z","submitted_at":"2025-06-17T20:24:00Z","title":"Revisiting Reinforcement Learning for LLM Reasoning from A Cross-Domain Perspective","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T00:13:50.476121Z"},"links":{"citing_paper":"/paper/2506.14965"},"observation_digest":"sha256:9112b64db1f8b710de49e9c1da7c2982d0bdd287ce37f9097a893ee77b5f1ffc","observation_id":"8662592c-77f6-4ca8-ac2d-de10044aa35c","resolution":{"observed_at":"2026-08-07T00:13:57.101323Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:13:56.808805Z","title":"The prime factorization of 901 is 17 × 53, so p = 17 and q = 53 (or vice versa)","venue":null,"work_id":"ca628987-d9ce-4c5d-a2f7-9262a610ae66","year":null},"citing_paper":{"arxiv_id":"2506.14965","last_updated":"2025-06-17T20:24:00Z","snapshot_observed_at":"2026-08-07T00:07:18.793298Z","submitted_at":"2025-06-17T20:24:00Z","title":"Revisiting Reinforcement Learning for LLM Reasoning from A Cross-Domain Perspective","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T00:13:50.616320Z"},"links":{"citing_paper":"/paper/2506.14965"},"observation_digest":"sha256:a7290c00a214bd3fdc8531646e58eead3bcf200e2232729f35115fe6a025e041","observation_id":"548e4237-aed6-4703-aad2-1c1b2f0113a9","resolution":{"observed_at":"2026-08-07T00:13:56.912958Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:13:56.589815Z","title":null,"venue":null,"work_id":"bc79896a-7eb3-4825-9ce3-7f4a1dffc185","year":null},"citing_paper":{"arxiv_id":"2506.14965","last_updated":"2025-06-17T20:24:00Z","snapshot_observed_at":"2026-08-07T00:07:18.793298Z","submitted_at":"2025-06-17T20:24:00Z","title":"Revisiting Reinforcement Learning for LLM Reasoning from A Cross-Domain Perspective","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T00:13:50.769658Z"},"links":{"citing_paper":"/paper/2506.14965"},"observation_digest":"sha256:852e5cfd0bb818d5d3f2f0d83aec4f4adcb292768917361f1fb494dcae52fe95","observation_id":"71f0f3b6-de95-4441-9b64-4f8793f176ba","resolution":{"observed_at":"2026-08-07T00:13:56.720067Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:13:56.324481Z","title":null,"venue":null,"work_id":"7403b4d1-c38d-40da-805d-5f1ca57c84d2","year":null},"citing_paper":{"arxiv_id":"2506.14965","last_updated":"2025-06-17T20:24:00Z","snapshot_observed_at":"2026-08-07T00:07:18.793298Z","submitted_at":"2025-06-17T20:24:00Z","title":"Revisiting Reinforcement Learning for LLM Reasoning from A Cross-Domain Perspective","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T00:13:50.900809Z"},"links":{"citing_paper":"/paper/2506.14965"},"observation_digest":"sha256:9d36c3bfde571b365eb05478fa6e586a2bdd63a50a12dcd2193a38d8417496bf","observation_id":"40d3ce10-ab8c-4b2f-a6e7-ea8f0bf71a7c","resolution":{"observed_at":"2026-08-07T00:13:56.466138Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:13:56.112449Z","title":null,"venue":null,"work_id":"b2c4f4ff-08d9-4dc8-8ea3-bb7d7f9e08ac","year":null},"citing_paper":{"arxiv_id":"2506.14965","last_updated":"2025-06-17T20:24:00Z","snapshot_observed_at":"2026-08-07T00:07:18.793298Z","submitted_at":"2025-06-17T20:24:00Z","title":"Revisiting Reinforcement Learning for LLM Reasoning from A Cross-Domain Perspective","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T00:13:51.009985Z"},"links":{"citing_paper":"/paper/2506.14965"},"observation_digest":"sha256:ecb84d9271ba833990f948f0969210c3189452ba47bf87cae04da15b7cfb033a","observation_id":"e56162b0-1cf8-47ee-be70-183e190f68b5","resolution":{"observed_at":"2026-08-07T00:13:56.208238Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:13:55.784917Z","title":"This means 3 × 555 mod 832 = 1","venue":null,"work_id":"6f76598c-1a6a-4247-9f34-69b4fd98e2da","year":null},"citing_paper":{"arxiv_id":"2506.14965","last_updated":"2025-06-17T20:24:00Z","snapshot_observed_at":"2026-08-07T00:07:18.793298Z","submitted_at":"2025-06-17T20:24:00Z","title":"Revisiting Reinforcement Learning for LLM Reasoning from A Cross-Domain Perspective","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T00:13:51.135289Z"},"links":{"citing_paper":"/paper/2506.14965"},"observation_digest":"sha256:afc36df427d9b24b72ef1a767a418cc4e487f841088e92c6737a0059befe5c64","observation_id":"2e93df25-5d81-411b-99fc-5789220fec3c","resolution":{"observed_at":"2026-08-07T00:13:55.968485Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:13:55.493706Z","title":null,"venue":null,"work_id":"8c1dc167-09b2-4ab2-8735-5de048432cf4","year":null},"citing_paper":{"arxiv_id":"2506.14965","last_updated":"2025-06-17T20:24:00Z","snapshot_observed_at":"2026-08-07T00:07:18.793298Z","submitted_at":"2025-06-17T20:24:00Z","title":"Revisiting Reinforcement Learning for LLM Reasoning from A Cross-Domain Perspective","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T00:13:51.261466Z"},"links":{"citing_paper":"/paper/2506.14965"},"observation_digest":"sha256:56b3b268d7dc9343d2b2071e024d88f63b6fb71d17e343471b2d7d214c1b115f","observation_id":"53a754e9-234e-48cd-a62f-437d649cfbef","resolution":{"observed_at":"2026-08-07T00:13:55.624048Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:13:55.243328Z","title":null,"venue":null,"work_id":"56d44de8-b04d-40b8-85ae-8b97ac3d9110","year":null},"citing_paper":{"arxiv_id":"2506.14965","last_updated":"2025-06-17T20:24:00Z","snapshot_observed_at":"2026-08-07T00:07:18.793298Z","submitted_at":"2025-06-17T20:24:00Z","title":"Revisiting Reinforcement Learning for LLM Reasoning from A Cross-Domain Perspective","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T00:13:51.373288Z"},"links":{"citing_paper":"/paper/2506.14965"},"observation_digest":"sha256:b34073a0998d072d22a226c3198ee76ed36efc644e6b2ec333dba18500c7f5d8","observation_id":"c0cc73c5-82b0-4762-a70f-33b77bcb26fe","resolution":{"observed_at":"2026-08-07T00:13:55.345857Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:13:54.942999Z","title":null,"venue":null,"work_id":"be29549b-44fb-4edc-8172-bfcfc5d8a1cd","year":null},"citing_paper":{"arxiv_id":"2506.14965","last_updated":"2025-06-17T20:24:00Z","snapshot_observed_at":"2026-08-07T00:07:18.793298Z","submitted_at":"2025-06-17T20:24:00Z","title":"Revisiting Reinforcement Learning for LLM Reasoning from A Cross-Domain Perspective","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T00:13:51.494238Z"},"links":{"citing_paper":"/paper/2506.14965"},"observation_digest":"sha256:56499ac1fa9e301e3b3accd85bc92aa163655d163be53ea9a2f6aa37f2521667","observation_id":"ea9d8924-6369-4f9a-b0ee-a2c5d2e6c470","resolution":{"observed_at":"2026-08-07T00:13:55.067313Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:13:54.698119Z","title":"p\": 17,","venue":null,"work_id":"e0ab7ba9-9040-4252-969c-1dfa0f6ed93e","year":2009},"citing_paper":{"arxiv_id":"2506.14965","last_updated":"2025-06-17T20:24:00Z","snapshot_observed_at":"2026-08-07T00:07:18.793298Z","submitted_at":"2025-06-17T20:24:00Z","title":"Revisiting Reinforcement Learning for LLM Reasoning from A Cross-Domain Perspective","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-07T00:13:51.655727Z"},"links":{"citing_paper":"/paper/2506.14965"},"observation_digest":"sha256:4c3d96a4733fe9015bd2d2ae791153b2c04b1a71148b740e0ccc3c5db336889a","observation_id":"95f034e0-584d-42e8-9b33-bf6f4229a4ee","resolution":{"observed_at":"2026-08-07T00:13:54.820126Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:13:54.388329Z","title":null,"venue":null,"work_id":"a71b04db-74af-4031-bb9e-4244384c258c","year":2011},"citing_paper":{"arxiv_id":"2506.14965","last_updated":"2025-06-17T20:24:00Z","snapshot_observed_at":"2026-08-07T00:07:18.793298Z","submitted_at":"2025-06-17T20:24:00Z","title":"Revisiting Reinforcement Learning for LLM Reasoning from A Cross-Domain Perspective","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-07T00:13:51.772786Z"},"links":{"citing_paper":"/paper/2506.14965"},"observation_digest":"sha256:be7a309a0102af706311ca06847e33dc42adb0403d36a5d14ad16f7113c7dce7","observation_id":"011ddf69-08e5-4da5-9471-161c7b2226e8","resolution":{"observed_at":"2026-08-07T00:13:54.560492Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:13:54.121784Z","title":null,"venue":null,"work_id":"ac3806d8-d5cc-433c-9bbb-5b484ca90a52","year":2011},"citing_paper":{"arxiv_id":"2506.14965","last_updated":"2025-06-17T20:24:00Z","snapshot_observed_at":"2026-08-07T00:07:18.793298Z","submitted_at":"2025-06-17T20:24:00Z","title":"Revisiting Reinforcement Learning for LLM Reasoning from A Cross-Domain Perspective","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-07T00:13:51.868126Z"},"links":{"citing_paper":"/paper/2506.14965"},"observation_digest":"sha256:4f76e86c88899c09f3e9f6efdfa0dc584bc5bc642265820df7a349781b295d91","observation_id":"f50becb5-bb82-4d67-8e73-054a4081ad62","resolution":{"observed_at":"2026-08-07T00:13:54.247177Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:13:53.861070Z","title":null,"venue":null,"work_id":"f9b454fa-ca0c-4d53-b1b7-d527de7a197a","year":2012},"citing_paper":{"arxiv_id":"2506.14965","last_updated":"2025-06-17T20:24:00Z","snapshot_observed_at":"2026-08-07T00:07:18.793298Z","submitted_at":"2025-06-17T20:24:00Z","title":"Revisiting Reinforcement Learning for LLM Reasoning from A Cross-Domain Perspective","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-07T00:13:51.983302Z"},"links":{"citing_paper":"/paper/2506.14965"},"observation_digest":"sha256:20fc5cfe29ab521cdf3824fd47e89c4e0699d9617d0f23f3fa43b629e14b1097","observation_id":"f3f10b22-49e6-4199-a844-39eeac744b0d","resolution":{"observed_at":"2026-08-07T00:13:53.979526Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:13:53.537530Z","title":null,"venue":null,"work_id":"3118a949-27bc-4da8-b20a-a73fef4ca22d","year":null},"citing_paper":{"arxiv_id":"2506.14965","last_updated":"2025-06-17T20:24:00Z","snapshot_observed_at":"2026-08-07T00:07:18.793298Z","submitted_at":"2025-06-17T20:24:00Z","title":"Revisiting Reinforcement Learning for LLM Reasoning from A Cross-Domain Perspective","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-07T00:13:52.163920Z"},"links":{"citing_paper":"/paper/2506.14965"},"observation_digest":"sha256:b9baff7a26f8ccebde6204a426e09046c3a82a4546ff335a3a714650b6b3769b","observation_id":"032dd5d9-aaa5-4e80-a23e-aebea949cecd","resolution":{"observed_at":"2026-08-07T00:13:53.717941Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:13:53.245436Z","title":null,"venue":null,"work_id":"515ac5c6-707e-4405-abcb-3676919d72b1","year":null},"citing_paper":{"arxiv_id":"2506.14965","last_updated":"2025-06-17T20:24:00Z","snapshot_observed_at":"2026-08-07T00:07:18.793298Z","submitted_at":"2025-06-17T20:24:00Z","title":"Revisiting Reinforcement Learning for LLM Reasoning from A Cross-Domain Perspective","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-07T00:13:52.267834Z"},"links":{"citing_paper":"/paper/2506.14965"},"observation_digest":"sha256:e62bbc1f9bb10603546ff87446b44a07b85b8557449bc3988f86708b078ca3ee","observation_id":"3fa4e05a-4bb8-4504-8adc-e482108b97af","resolution":{"observed_at":"2026-08-07T00:13:53.366095Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:13:52.956691Z","title":null,"venue":null,"work_id":"5b63b708-56fc-48d8-84cd-f1038415f07a","year":null},"citing_paper":{"arxiv_id":"2506.14965","last_updated":"2025-06-17T20:24:00Z","snapshot_observed_at":"2026-08-07T00:07:18.793298Z","submitted_at":"2025-06-17T20:24:00Z","title":"Revisiting Reinforcement Learning for LLM Reasoning from A Cross-Domain Perspective","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-07T00:13:52.382382Z"},"links":{"citing_paper":"/paper/2506.14965"},"observation_digest":"sha256:9955a05ad3f5313aaf5af4487b15414f5eba3d9a689f3ea828f4ab5f3cb08e7e","observation_id":"844fa836-7563-432a-90e9-589f1cb1b3c2","resolution":{"observed_at":"2026-08-07T00:13:53.068741Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:13:52.715061Z","title":null,"venue":null,"work_id":"2cdb8d2a-9a3b-4fb4-bb51-158f06db196f","year":null},"citing_paper":{"arxiv_id":"2506.14965","last_updated":"2025-06-17T20:24:00Z","snapshot_observed_at":"2026-08-07T00:07:18.793298Z","submitted_at":"2025-06-17T20:24:00Z","title":"Revisiting Reinforcement Learning for LLM Reasoning from A Cross-Domain Perspective","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-07T00:13:52.537874Z"},"links":{"citing_paper":"/paper/2506.14965"},"observation_digest":"sha256:0d4b7c8b8f2458c2118aaaddaae1fd9f1bfec21b3961b230075fab64f5a8bfd3","observation_id":"066e2452-4e7c-4be8-a09a-ffa35138cf4f","resolution":{"observed_at":"2026-08-07T00:13:52.822815Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:14:09.346262Z","title":"More specialized applications emerged with FinQA (Chen et al., 2021b) and ConvFinQA (Chen et al., 2022b), addressing TQA within the financial domain","venue":null,"work_id":"2a975815-33b8-4908-97bf-a9f139370139","year":2025},"citing_paper":{"arxiv_id":"2506.14965","last_updated":"2025-06-17T20:24:00Z","snapshot_observed_at":"2026-08-07T00:07:18.793298Z","submitted_at":"2025-06-17T20:24:00Z","title":"Revisiting Reinforcement Learning for LLM Reasoning from A Cross-Domain Perspective","version":1},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-07T00:13:45.296738Z"},"links":{"citing_paper":"/paper/2506.14965"},"observation_digest":"sha256:ddd9c4239a6b226a12fd6a03aace9046284c70bfd238980129375791493dd43c","observation_id":"84b07b2c-747b-41d3-bae5-54fa71256eed","resolution":{"observed_at":"2026-08-07T00:14:09.457129Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.01240","last_updated":"2023-03-02T03:54:28Z","snapshot_observed_at":"2026-07-06T13:59:15.998573Z","submitted_at":"2022-10-03T21:34:32Z","title":"Language Models Are Greedy Reasoners: A Systematic Formal Analysis of Chain-of-Thought","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.01240","snapshot_observed_at":"2026-08-07T00:13:45.222636Z","title":"A is at position 3","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.14965","last_updated":"2025-06-17T20:24:00Z","snapshot_observed_at":"2026-08-07T00:07:18.793298Z","submitted_at":"2025-06-17T20:24:00Z","title":"Revisiting Reinforcement Learning for LLM Reasoning from A Cross-Domain Perspective","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-07T00:13:45.222636Z"},"links":{"cited_paper":"/paper/2210.01240","citing_paper":"/paper/2506.14965"},"observation_digest":"sha256:8c726266453257b9ca7c8b02e00e13c6b91d2d4ae7411115f5ed9b41892e91fc","observation_id":"c29a27ce-28de-41c8-a0e1-1ac2ecb79cfa","resolution":{"observed_at":"2026-08-07T00:13:45.222636Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2506.14965","last_updated":"2025-06-17T20:24:00Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-07T00:07:18.793298Z","submitted_at":"2025-06-17T20:24:00Z","title":"Revisiting Reinforcement Learning for LLM Reasoning from A Cross-Domain Perspective"},"reference_resolution":{"displayed":58,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":48,"verified_exact":0,"verified_fuzzy":10},"total_outbound_references":58},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 58 of 58 outbound references and 13 inbound Pith citation observations for arXiv:2506.14965."}