{"as_of":"2026-08-18T08:21:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:147f4d857608b2f71851c6ea182546bdcd2c94a1b067fc23c872b2b00413a5b5","coverage":[{"denominator":59,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":59,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T14:48:00.129155Z","state":"measured"},{"denominator":76,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":76,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-18T06:34:40.430872+00:00","state":"measured"},{"denominator":17,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":17,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T20:40:13.872622Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-03T13:28:18.208570Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.17667","last_updated":"2025-05-27T09:39:47Z","snapshot_observed_at":"2026-08-15T02:30:25.857561Z","submitted_at":"2025-05-23T09:31:55Z","title":"QwenLong-L1: Towards Long-Context Large Reasoning Models with Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2505.17667","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.17667","snapshot_observed_at":"2026-07-03T13:28:18.208570Z","title":"Qwenlong-l1: Towards long-context large reasoning models with reinforcement learning","venue":null,"work_id":"5eb4668b-c05a-469e-87fa-d57ca82bfefb","year":2025},"citing_paper":{"arxiv_id":"2507.02259","last_updated":"2026-07-29T12:55:39Z","snapshot_observed_at":"2026-08-13T13:14:28.835248Z","submitted_at":"2025-07-03T03:11:50Z","title":"MemAgent: Reshaping Long-Context LLM with Multi-Conv RL-based Memory Agent","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-05-15T11:17:24.406028Z"},"links":{"cited_paper":"/paper/2505.17667","citing_paper":"/paper/2507.02259"},"observation_digest":"sha256:c5e44fbcce65362c196cdf0280e3e8bc8111a5c1ebdcdfdcf9fb9008d360f52e","observation_id":"3e123b75-b515-4470-9423-af84373323fd","resolution":{"observed_at":"2026-05-15T11:17:24.509718Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.17667","last_updated":"2025-05-27T09:39:47Z","snapshot_observed_at":"2026-08-15T02:30:25.857561Z","submitted_at":"2025-05-23T09:31:55Z","title":"QwenLong-L1: Towards Long-Context Large Reasoning Models with Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.17667","snapshot_observed_at":"2026-08-06T20:40:13.872622Z","title":"Qwenlong-l1: Towards long-context large reasoning models with reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.02259","last_updated":"2026-07-29T12:55:39Z","snapshot_observed_at":"2026-08-13T13:14:28.835248Z","submitted_at":"2025-07-03T03:11:50Z","title":"MemAgent: Reshaping Long-Context LLM with Multi-Conv RL-based Memory Agent","version":2},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-06T20:40:13.872622Z"},"links":{"cited_paper":"/paper/2505.17667","citing_paper":"/paper/2507.02259"},"observation_digest":"sha256:60c5437034069adf52bf2773c5b0fad62d12ca8bcb7c4cc7e01ffa274b13189a","observation_id":"a10e8dbd-42af-4c9b-a662-fe5340c17dce","resolution":{"observed_at":"2026-08-06T20:40:13.872622Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.17667","last_updated":"2025-05-27T09:39:47Z","snapshot_observed_at":"2026-08-15T02:30:25.857561Z","submitted_at":"2025-05-23T09:31:55Z","title":"QwenLong-L1: Towards Long-Context Large Reasoning Models with Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.17667","snapshot_observed_at":"2026-08-05T22:55:15.281023Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.06189","last_updated":"2025-08-19T11:14:11Z","snapshot_observed_at":"2026-08-17T12:37:53.343495Z","submitted_at":"2025-08-08T10:12:00Z","title":"MA-CBP: A Criminal Behavior Prediction Framework Based on Multi-Agent Asynchronous Collaboration","version":2},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-05T22:55:15.281023Z"},"links":{"cited_paper":"/paper/2505.17667","citing_paper":"/paper/2508.06189"},"observation_digest":"sha256:0bf535d393c5245f5605ff2d1a5b0258df2959023f7622283d677937dca36419","observation_id":"e837cc81-3032-4a7f-a807-9b9901e3ce50","resolution":{"observed_at":"2026-08-05T22:55:15.281023Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.17667","last_updated":"2025-05-27T09:39:47Z","snapshot_observed_at":"2026-08-15T02:30:25.857561Z","submitted_at":"2025-05-23T09:31:55Z","title":"QwenLong-L1: Towards Long-Context Large Reasoning Models with Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.17667","snapshot_observed_at":"2026-08-05T22:45:16.164641Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.06464","last_updated":"2025-08-08T17:13:00Z","snapshot_observed_at":"2026-08-17T11:18:05.323995Z","submitted_at":"2025-08-08T17:13:00Z","title":"Observation of momentum dependent charge density wave gap in EuTe4","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-05T22:45:16.164641Z"},"links":{"cited_paper":"/paper/2505.17667","citing_paper":"/paper/2508.06464"},"observation_digest":"sha256:6b538e8b464c03f3659d7f6904d83ce563c2004e5b50808dcd87b468e0f31c8c","observation_id":"cf7f53f6-838c-425f-82d3-2ef30ef5c63e","resolution":{"observed_at":"2026-08-05T22:45:16.164641Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.17667","last_updated":"2025-05-27T09:39:47Z","snapshot_observed_at":"2026-08-15T02:30:25.857561Z","submitted_at":"2025-05-23T09:31:55Z","title":"QwenLong-L1: Towards Long-Context Large Reasoning Models with Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2505.17667","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.17667","snapshot_observed_at":"2026-07-03T13:28:18.208570Z","title":"Qwenlong-l1: Towards long-context large reasoning models with reinforcement learning","venue":null,"work_id":"5eb4668b-c05a-469e-87fa-d57ca82bfefb","year":2025},"citing_paper":{"arxiv_id":"2508.06471","last_updated":"2025-08-08T17:21:06Z","snapshot_observed_at":"2026-08-11T03:34:09.767397Z","submitted_at":"2025-08-08T17:21:06Z","title":"GLM-4.5: Agentic, Reasoning, and Coding (ARC) Foundation Models","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-11T17:50:08.399160Z"},"links":{"cited_paper":"/paper/2505.17667","citing_paper":"/paper/2508.06471"},"observation_digest":"sha256:0d12b8e9cdeec6a8f5d3b7c91fc58ac9fead83f33c73cc1e211ff62ad2e8556e","observation_id":"8b38a9a7-7814-4433-8295-e3566f2c684b","resolution":{"observed_at":"2026-05-11T17:50:08.524006Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.17667","last_updated":"2025-05-27T09:39:47Z","snapshot_observed_at":"2026-08-15T02:30:25.857561Z","submitted_at":"2025-05-23T09:31:55Z","title":"QwenLong-L1: Towards Long-Context Large Reasoning Models with Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.17667","snapshot_observed_at":"2026-08-05T15:09:05.968531Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.20468","last_updated":"2025-08-28T06:39:25Z","snapshot_observed_at":"2026-08-13T16:07:29.621607Z","submitted_at":"2025-08-28T06:39:25Z","title":"ConspirED: A Dataset for Cognitive Traits of Conspiracy Theories and Large Language Model Safety","version":1},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-08-05T15:09:05.968531Z"},"links":{"cited_paper":"/paper/2505.17667","citing_paper":"/paper/2508.20468"},"observation_digest":"sha256:22d2b7cd48d476fef95fee8748eb71c19398814677321730cbd2f4ea4f22214a","observation_id":"aa3c5603-7403-45e7-86eb-b38a7ab0e77a","resolution":{"observed_at":"2026-08-05T15:09:05.968531Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.17667","last_updated":"2025-05-27T09:39:47Z","snapshot_observed_at":"2026-08-15T02:30:25.857561Z","submitted_at":"2025-05-23T09:31:55Z","title":"QwenLong-L1: Towards Long-Context Large Reasoning Models with Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2505.17667","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.17667","snapshot_observed_at":"2026-07-03T13:28:18.208570Z","title":"Qwenlong-l1: Towards long-context large reasoning models with reinforcement learning","venue":null,"work_id":"5eb4668b-c05a-469e-87fa-d57ca82bfefb","year":2025},"citing_paper":{"arxiv_id":"2604.02371","last_updated":"2026-06-29T16:52:45Z","snapshot_observed_at":"2026-08-11T00:23:10.170872Z","submitted_at":"2026-03-31T04:41:01Z","title":"Internalized Reasoning for Long-Context Visual Document Understanding","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-05-13T23:53:19.148407Z"},"links":{"cited_paper":"/paper/2505.17667","citing_paper":"/paper/2604.02371"},"observation_digest":"sha256:b3aaf020f24caea15712cc9be6013f14c7e668c0b6dd897c25ddb30006a33c4f","observation_id":"2cbaf1f8-7acd-4ada-b28d-537dea77f30a","resolution":{"observed_at":"2026-05-13T23:53:28.051553Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.17667","last_updated":"2025-05-27T09:39:47Z","snapshot_observed_at":"2026-08-15T02:30:25.857561Z","submitted_at":"2025-05-23T09:31:55Z","title":"QwenLong-L1: Towards Long-Context Large Reasoning Models with Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.17667","snapshot_observed_at":"2026-07-13T15:50:49.083652Z","title":"Qwenlong-l1: Towards long-context large reasoning models with reinforcement learning, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2604.02371","last_updated":"2026-06-29T16:52:45Z","snapshot_observed_at":"2026-08-11T00:23:10.170872Z","submitted_at":"2026-03-31T04:41:01Z","title":"Internalized Reasoning for Long-Context Visual Document Understanding","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-07-13T15:50:49.083652Z"},"links":{"cited_paper":"/paper/2505.17667","citing_paper":"/paper/2604.02371"},"observation_digest":"sha256:b11d3568f1fcc46a92196fc05198abd72819f556b936f70a6923879e7202f727","observation_id":"7416320e-45b1-46f1-b594-5636eb518597","resolution":{"observed_at":"2026-07-13T15:50:49.083652Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.17667","last_updated":"2025-05-27T09:39:47Z","snapshot_observed_at":"2026-08-15T02:30:25.857561Z","submitted_at":"2025-05-23T09:31:55Z","title":"QwenLong-L1: Towards Long-Context Large Reasoning Models with Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2505.17667","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.17667","snapshot_observed_at":"2026-07-03T13:28:18.208570Z","title":"Qwenlong-l1: Towards long-context large reasoning models with reinforcement learning","venue":null,"work_id":"5eb4668b-c05a-469e-87fa-d57ca82bfefb","year":2025},"citing_paper":{"arxiv_id":"2604.07981","last_updated":"2026-04-09T08:51:47Z","snapshot_observed_at":"2026-08-17T11:35:42.924796Z","submitted_at":"2026-04-09T08:51:47Z","title":"A Decomposition Perspective to Long-context Reasoning for LLMs","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-10T18:05:34.666937Z"},"links":{"cited_paper":"/paper/2505.17667","citing_paper":"/paper/2604.07981"},"observation_digest":"sha256:e342034575c328d4581662f67f148c45b8732e60c3e207f60c1cf6671fc52126","observation_id":"12109965-067d-4e1f-af18-3eafcfa9dc17","resolution":{"observed_at":"2026-05-11T05:31:00.039292Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.17667","last_updated":"2025-05-27T09:39:47Z","snapshot_observed_at":"2026-08-15T02:30:25.857561Z","submitted_at":"2025-05-23T09:31:55Z","title":"QwenLong-L1: Towards Long-Context Large Reasoning Models with Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2505.17667","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.17667","snapshot_observed_at":"2026-07-03T13:28:18.208570Z","title":"Qwenlong-l1: Towards long-context large reasoning models with reinforcement learning","venue":null,"work_id":"5eb4668b-c05a-469e-87fa-d57ca82bfefb","year":2025},"citing_paper":{"arxiv_id":"2604.14922","last_updated":"2026-04-16T12:06:59Z","snapshot_observed_at":"2026-08-17T12:20:14.528524Z","submitted_at":"2026-04-16T12:06:59Z","title":"LongAct: Harnessing Intrinsic Activation Patterns for Long-Context Reinforcement Learning","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-05-10T11:17:43.769244Z"},"links":{"cited_paper":"/paper/2505.17667","citing_paper":"/paper/2604.14922"},"observation_digest":"sha256:699f51f45c2757610a621466450ea940dc7d98aae9afe61de219f8526f5251f2","observation_id":"36cfaa94-33ae-4009-9417-ef4af0b4d499","resolution":{"observed_at":"2026-05-10T11:20:10.482511Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.17667","last_updated":"2025-05-27T09:39:47Z","snapshot_observed_at":"2026-08-15T02:30:25.857561Z","submitted_at":"2025-05-23T09:31:55Z","title":"QwenLong-L1: Towards Long-Context Large Reasoning Models with Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2505.17667","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.17667","snapshot_observed_at":"2026-07-03T13:28:18.208570Z","title":"Qwenlong-l1: Towards long-context large reasoning models with reinforcement learning","venue":null,"work_id":"5eb4668b-c05a-469e-87fa-d57ca82bfefb","year":2025},"citing_paper":{"arxiv_id":"2604.17535","last_updated":"2026-04-19T16:53:56Z","snapshot_observed_at":"2026-08-13T17:23:59.909337Z","submitted_at":"2026-04-19T16:53:56Z","title":"OPSDL: On-Policy Self-Distillation for Long-Context Language Models","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-10T06:07:36.830550Z"},"links":{"cited_paper":"/paper/2505.17667","citing_paper":"/paper/2604.17535"},"observation_digest":"sha256:8c3fe91572888a2163edf42358374eaa576bb4985d07a6f3cc8016af5471d697","observation_id":"a4c46b9d-afc2-44c0-8e74-c1e1e34d5cff","resolution":{"observed_at":"2026-05-10T06:11:20.402410Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.17667","last_updated":"2025-05-27T09:39:47Z","snapshot_observed_at":"2026-08-15T02:30:25.857561Z","submitted_at":"2025-05-23T09:31:55Z","title":"QwenLong-L1: Towards Long-Context Large Reasoning Models with Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2505.17667","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.17667","snapshot_observed_at":"2026-07-03T13:28:18.208570Z","title":"Qwenlong-l1: Towards long-context large reasoning models with reinforcement learning","venue":null,"work_id":"5eb4668b-c05a-469e-87fa-d57ca82bfefb","year":2025},"citing_paper":{"arxiv_id":"2605.04831","last_updated":"2026-05-06T12:28:17Z","snapshot_observed_at":"2026-08-15T16:16:01.364447Z","submitted_at":"2026-05-06T12:28:17Z","title":"StoryAlign: Evaluating and Training Reward Models for Story Generation","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-08T17:29:13.549559Z"},"links":{"cited_paper":"/paper/2505.17667","citing_paper":"/paper/2605.04831"},"observation_digest":"sha256:334674fc145579e6aeaeeaabc5207d512bd6d02308a236ea27c8b8f81648fd33","observation_id":"6e5e2916-47b9-4935-9b3a-d04314fb4766","resolution":{"observed_at":"2026-05-11T17:31:07.683022Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.17667","last_updated":"2025-05-27T09:39:47Z","snapshot_observed_at":"2026-08-15T02:30:25.857561Z","submitted_at":"2025-05-23T09:31:55Z","title":"QwenLong-L1: Towards Long-Context Large Reasoning Models with Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2505.17667","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.17667","snapshot_observed_at":"2026-07-03T13:28:18.208570Z","title":"Qwenlong-l1: Towards long-context large reasoning models with reinforcement learning","venue":null,"work_id":"5eb4668b-c05a-469e-87fa-d57ca82bfefb","year":2025},"citing_paper":{"arxiv_id":"2605.12227","last_updated":"2026-06-16T16:53:23Z","snapshot_observed_at":"2026-07-06T23:23:59.123377Z","submitted_at":"2026-05-12T15:04:18Z","title":"A Recipe for Long-Context Reasoning in Large Language Models via On-Policy Optimization and Distillation","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-05-13T05:29:00.576006Z"},"links":{"cited_paper":"/paper/2505.17667","citing_paper":"/paper/2605.12227"},"observation_digest":"sha256:7d882048a62c3a5ccdcc9936ad3c872b2b35ef67d0341af1913d03920fcacee3","observation_id":"e6d73681-e8af-4b44-bf0c-fa94aad81275","resolution":{"observed_at":"2026-05-13T05:32:19.432348Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.17667","last_updated":"2025-05-27T09:39:47Z","snapshot_observed_at":"2026-08-15T02:30:25.857561Z","submitted_at":"2025-05-23T09:31:55Z","title":"QwenLong-L1: Towards Long-Context Large Reasoning Models with Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2505.17667","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.17667","snapshot_observed_at":"2026-07-03T13:28:18.208570Z","title":"Qwenlong-l1: Towards long-context large reasoning models with reinforcement learning","venue":null,"work_id":"5eb4668b-c05a-469e-87fa-d57ca82bfefb","year":2025},"citing_paper":{"arxiv_id":"2607.02073","last_updated":"2026-07-02T12:11:49Z","snapshot_observed_at":"2026-08-16T03:55:09.783871Z","submitted_at":"2026-07-02T12:11:49Z","title":"Evidence-State Rewards for Long-Context Reasoning","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-07-03T13:25:14.844589Z"},"links":{"cited_paper":"/paper/2505.17667","citing_paper":"/paper/2607.02073"},"observation_digest":"sha256:de7daafce01c8592b272c2bbda36bf6cb0aa8e05abc87c59a21d3191b1557789","observation_id":"c837ddf0-367f-4f48-9c06-6fa5362361eb","resolution":{"observed_at":"2026-07-03T13:28:18.210189Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.17667","last_updated":"2025-05-27T09:39:47Z","snapshot_observed_at":"2026-08-15T02:30:25.857561Z","submitted_at":"2025-05-23T09:31:55Z","title":"QwenLong-L1: Towards Long-Context Large Reasoning Models with Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.17667","snapshot_observed_at":"2026-08-01T12:46:03.589144Z","title":"Fanqi Wan, Weizhou Shen, Shengyi Liao, Yingcheng Shi, Chenliang Li, Ziyi Yang, Ji Zhang, Fei Huang, Jingren Zhou, and Ming Yan","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.19345","last_updated":"2026-07-31T16:09:53Z","snapshot_observed_at":"2026-08-16T05:37:09.087134Z","submitted_at":"2026-07-21T17:59:21Z","title":"Copy Less, Ground More: Overcoming Repetitive Copying in Long-Context Reasoning via Evidence-Aware Reinforcement Learning","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-01T12:46:03.589144Z"},"links":{"cited_paper":"/paper/2505.17667","citing_paper":"/paper/2607.19345"},"observation_digest":"sha256:030eab8146dfd61cfcfae86532c054a15f52a6338384e908325c151406b01202","observation_id":"4e9f7c26-e957-4b75-b019-4d3c7c6d1dbf","resolution":{"observed_at":"2026-08-01T12:46:03.589144Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.17667","last_updated":"2025-05-27T09:39:47Z","snapshot_observed_at":"2026-08-15T02:30:25.857561Z","submitted_at":"2025-05-23T09:31:55Z","title":"QwenLong-L1: Towards Long-Context Large Reasoning Models with Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.17667","snapshot_observed_at":"2026-08-03T01:57:53.449669Z","title":"Fanqi Wan, Weizhou Shen, Shengyi Liao, Yingcheng Shi, Chenliang Li, Ziyi Yang, Ji Zhang, Fei Huang, Jingren Zhou, and Ming Yan","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.19345","last_updated":"2026-07-31T16:09:53Z","snapshot_observed_at":"2026-08-16T05:37:09.087134Z","submitted_at":"2026-07-21T17:59:21Z","title":"Copy Less, Ground More: Overcoming Repetitive Copying in Long-Context Reasoning via Evidence-Aware Reinforcement Learning","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-03T01:57:53.449669Z"},"links":{"cited_paper":"/paper/2505.17667","citing_paper":"/paper/2607.19345"},"observation_digest":"sha256:ba628ec056010dc96d1c28ef2157634fa9b62c4b3bdb58fce6a1a2ef578db80b","observation_id":"9f3e8f69-c2da-48ed-90f6-f9289cc9115d","resolution":{"observed_at":"2026-08-03T01:57:53.449669Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.17667","last_updated":"2025-05-27T09:39:47Z","snapshot_observed_at":"2026-08-15T02:30:25.857561Z","submitted_at":"2025-05-23T09:31:55Z","title":"QwenLong-L1: Towards Long-Context Large Reasoning Models with Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.17667","snapshot_observed_at":"2026-08-01T09:18:46.780870Z","title":"2025.Qwenlong- l1: Towards long-context large reasoning models with reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.20833","last_updated":"2026-07-29T08:05:59Z","snapshot_observed_at":"2026-08-15T14:36:45.682865Z","submitted_at":"2026-07-23T01:41:17Z","title":"REFACT: Adaptive Fact Restatement for Compact and Faithful Chain-of-Thought Reasoning","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-01T09:18:46.780870Z"},"links":{"cited_paper":"/paper/2505.17667","citing_paper":"/paper/2607.20833"},"observation_digest":"sha256:2d569a62a2c1f95b2003460589cfcf3085ab9817ce89134d905bcb8bb5f95fcc","observation_id":"ed144155-1032-4489-b5af-d358ca4d980e","resolution":{"observed_at":"2026-08-01T09:18:46.780870Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2505.17667/citation-record","integrity":"/paper/2505.17667/integrity","json":"/paper/2505.17667/citation-record.json","paper":"/paper/2505.17667"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:48:04.203833Z","title":"Claude 3.7 sonnet system card, Feburary 2025","venue":null,"work_id":"2be0ac75-3dec-421e-901f-2bba65cb2285","year":2025},"citing_paper":{"arxiv_id":"2505.17667","last_updated":"2025-05-27T09:39:47Z","snapshot_observed_at":"2026-08-15T02:30:25.857561Z","submitted_at":"2025-05-23T09:31:55Z","title":"QwenLong-L1: Towards Long-Context Large Reasoning Models with Reinforcement Learning","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T14:47:54.108255Z"},"links":{"citing_paper":"/paper/2505.17667"},"observation_digest":"sha256:5dccca6b6af86db7a37476e3ec4e6261f47563c8e7cce344fdb3b0d664cd6fc9","observation_id":"ac731f42-ec22-4d6c-9ee9-351aa5787b09","resolution":{"observed_at":"2026-08-07T14:48:04.276318Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:47:54.174129Z","title":"LongBench: A bilingual, multitask benchmark for long context understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.17667","last_updated":"2025-05-27T09:39:47Z","snapshot_observed_at":"2026-08-15T02:30:25.857561Z","submitted_at":"2025-05-23T09:31:55Z","title":"QwenLong-L1: Towards Long-Context Large Reasoning Models with Reinforcement Learning","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T14:47:54.174129Z"},"links":{"citing_paper":"/paper/2505.17667"},"observation_digest":"sha256:8c2c2813fabeb61d8242ec4cf1a159569b6e7a263d6a2453ccb3e033cbc88f24","observation_id":"428b97af-075e-4a64-b2da-e51e870947cb","resolution":{"observed_at":"2026-08-07T14:47:54.174129Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.01456","last_updated":"2025-09-26T09:25:31Z","snapshot_observed_at":"2026-08-17T04:59:59.434643Z","submitted_at":"2025-02-03T15:43:48Z","title":"Process Reinforcement through Implicit Rewards","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.01456","snapshot_observed_at":"2026-08-07T14:47:54.301320Z","title":"Process reinforcement through implicit rewards","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.17667","last_updated":"2025-05-27T09:39:47Z","snapshot_observed_at":"2026-08-15T02:30:25.857561Z","submitted_at":"2025-05-23T09:31:55Z","title":"QwenLong-L1: Towards Long-Context Large Reasoning Models with Reinforcement Learning","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T14:47:54.301320Z"},"links":{"cited_paper":"/paper/2502.01456","citing_paper":"/paper/2505.17667"},"observation_digest":"sha256:d3d53cf6122a635d3a61a6c0b7029cd133ab2db442180d05ffc75b79f295509b","observation_id":"dccea908-1f63-4ee0-a623-c2e2f93b4de8","resolution":{"observed_at":"2026-08-07T14:47:54.301320Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:47:54.367277Z","title":"Thinking, fast and slow","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.17667","last_updated":"2025-05-27T09:39:47Z","snapshot_observed_at":"2026-08-15T02:30:25.857561Z","submitted_at":"2025-05-23T09:31:55Z","title":"QwenLong-L1: Towards Long-Context Large Reasoning Models with Reinforcement Learning","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T14:47:54.367277Z"},"links":{"citing_paper":"/paper/2505.17667"},"observation_digest":"sha256:72a5cbcb8f4789b0c2b3857ff2320a732138a6b72cf4ec461b72a9fac61e814a","observation_id":"5bcfd899-cebd-4adf-8532-464381b043e8","resolution":{"observed_at":"2026-08-07T14:47:54.367277Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:48:03.957502Z","title":"A dataset of information-seeking questions and answers anchored in research papers","venue":null,"work_id":"9433d469-de6e-4901-b553-b170ea48ecf2","year":2021},"citing_paper":{"arxiv_id":"2505.17667","last_updated":"2025-05-27T09:39:47Z","snapshot_observed_at":"2026-08-15T02:30:25.857561Z","submitted_at":"2025-05-23T09:31:55Z","title":"QwenLong-L1: Towards Long-Context Large Reasoning Models with Reinforcement Learning","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T14:47:54.465404Z"},"links":{"citing_paper":"/paper/2505.17667"},"observation_digest":"sha256:5a220c9065c52879bb55377e09d05bd7c0c83ff0f54ef722495d5427dd18df05","observation_id":"2c80ca3c-6bcd-4ddb-804f-82c9bc6d6d7d","resolution":{"observed_at":"2026-08-07T14:48:04.052534Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:47:54.542819Z","title":"Deepseek-r1-lite-preview is now live: unleashing supercharged reasoning power!, November 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.17667","last_updated":"2025-05-27T09:39:47Z","snapshot_observed_at":"2026-08-15T02:30:25.857561Z","submitted_at":"2025-05-23T09:31:55Z","title":"QwenLong-L1: Towards Long-Context Large Reasoning Models with Reinforcement Learning","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T14:47:54.542819Z"},"links":{"citing_paper":"/paper/2505.17667"},"observation_digest":"sha256:5e1496ec5139b6426bbbfe28e200131c6b912f67f72e1a3564c60eccbebc1f75","observation_id":"0ffeb1d1-5335-4866-8c4a-d046b8ec48f1","resolution":{"observed_at":"2026-08-07T14:47:54.542819Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.06807","last_updated":"2025-02-18T22:21:40Z","snapshot_observed_at":"2026-08-16T21:32:22.938353Z","submitted_at":"2025-02-03T23:00:15Z","title":"Competitive Programming with Large Reasoning Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.06807","snapshot_observed_at":"2026-08-07T14:47:54.628265Z","title":"Competitive programming with large reasoning models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.17667","last_updated":"2025-05-27T09:39:47Z","snapshot_observed_at":"2026-08-15T02:30:25.857561Z","submitted_at":"2025-05-23T09:31:55Z","title":"QwenLong-L1: Towards Long-Context Large Reasoning Models with Reinforcement Learning","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T14:47:54.628265Z"},"links":{"cited_paper":"/paper/2502.06807","citing_paper":"/paper/2505.17667"},"observation_digest":"sha256:7c5e6a7cc9e2e1d1b3920e70e1f44fb83688b3e5cdf2d433794271d68c8c3d72","observation_id":"76e19ce2-d0ac-4641-90bf-8a32e2b248e1","resolution":{"observed_at":"2026-08-07T14:47:54.628265Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:48:03.720354Z","title":"Open r1: A fully open reproduction of deepseek-r1, January 2025","venue":null,"work_id":"240811b2-f06b-4885-b6d5-6b84c99268b5","year":2025},"citing_paper":{"arxiv_id":"2505.17667","last_updated":"2025-05-27T09:39:47Z","snapshot_observed_at":"2026-08-15T02:30:25.857561Z","submitted_at":"2025-05-23T09:31:55Z","title":"QwenLong-L1: Towards Long-Context Large Reasoning Models with Reinforcement Learning","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T14:47:54.701599Z"},"links":{"citing_paper":"/paper/2505.17667"},"observation_digest":"sha256:3af020efd3f00f4f3ee8a5eff9cb64f6a4b6f6ecde77bff303b347e3cd923733","observation_id":"0555fc97-8e07-4f1f-a9d8-d1aadd3e6470","resolution":{"observed_at":"2026-08-07T14:48:03.849948Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:48:03.568389Z","title":"Data engineering for scaling language models to 128k context","venue":null,"work_id":"a4fa2a9e-6537-4217-9342-7d913d8638c6","year":2024},"citing_paper":{"arxiv_id":"2505.17667","last_updated":"2025-05-27T09:39:47Z","snapshot_observed_at":"2026-08-15T02:30:25.857561Z","submitted_at":"2025-05-23T09:31:55Z","title":"QwenLong-L1: Towards Long-Context Large Reasoning Models with Reinforcement Learning","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T14:47:54.798913Z"},"links":{"citing_paper":"/paper/2505.17667"},"observation_digest":"sha256:f057b14f9a11dc7cc2336bd41b3db061f5de40ead2c9c7fe2f1750a108790aba","observation_id":"c4e7b238-38c0-4755-b60d-e34b0766870d","resolution":{"observed_at":"2026-08-07T14:48:03.614383Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:47:54.906238Z","title":"How to train long-context language models (effectively)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.17667","last_updated":"2025-05-27T09:39:47Z","snapshot_observed_at":"2026-08-15T02:30:25.857561Z","submitted_at":"2025-05-23T09:31:55Z","title":"QwenLong-L1: Towards Long-Context Large Reasoning Models with Reinforcement Learning","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T14:47:54.906238Z"},"links":{"citing_paper":"/paper/2505.17667"},"observation_digest":"sha256:309aefe722fe44df2b5a122686d6e623c9302f7ab411b2f4d30e87430828ba61","observation_id":"50bb3bbf-3af0-44b5-b063-9be49de896b1","resolution":{"observed_at":"2026-08-07T14:47:54.906238Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-08-15T12:33:55.451951Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-07T14:47:54.988796Z","title":"Deepseek-r1: Incentivizing reasoning capability in llms via reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.17667","last_updated":"2025-05-27T09:39:47Z","snapshot_observed_at":"2026-08-15T02:30:25.857561Z","submitted_at":"2025-05-23T09:31:55Z","title":"QwenLong-L1: Towards Long-Context Large Reasoning Models with Reinforcement Learning","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T14:47:54.988796Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2505.17667"},"observation_digest":"sha256:67cc83b762243e2bc4732176029a67b14118c3f53e80d5a383037fa6adf8052d","observation_id":"c031e961-f33c-4414-901d-bee4467a7c34","resolution":{"observed_at":"2026-08-07T14:47:54.988796Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:47:55.096120Z","title":"Retrieval augmented language model pre-training","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.17667","last_updated":"2025-05-27T09:39:47Z","snapshot_observed_at":"2026-08-15T02:30:25.857561Z","submitted_at":"2025-05-23T09:31:55Z","title":"QwenLong-L1: Towards Long-Context Large Reasoning Models with Reinforcement Learning","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T14:47:55.096120Z"},"links":{"citing_paper":"/paper/2505.17667"},"observation_digest":"sha256:7e4057a11556c5cf70e2f3ed26aa97f6fb1748a0c04a2fdf5e56003f27d9f38c","observation_id":"bbe9bc61-4b9f-4c90-9c46-294a5ab5a65e","resolution":{"observed_at":"2026-08-07T14:47:55.096120Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:47:55.175370Z","title":"Constructing a multi-hop qa dataset for comprehensive evaluation of reasoning steps","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.17667","last_updated":"2025-05-27T09:39:47Z","snapshot_observed_at":"2026-08-15T02:30:25.857561Z","submitted_at":"2025-05-23T09:31:55Z","title":"QwenLong-L1: Towards Long-Context Large Reasoning Models with Reinforcement Learning","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T14:47:55.175370Z"},"links":{"citing_paper":"/paper/2505.17667"},"observation_digest":"sha256:46525db034ff20226ce4985e4e31a2b51516d5fd400d012a408e5fbdd7e6d75c","observation_id":"efa39379-c508-4126-a5be-ad8c50dec571","resolution":{"observed_at":"2026-08-07T14:47:55.175370Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:47:55.241433Z","title":"Open-reasoner-zero: An open source approach to scaling reinforcement learning on the base model, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.17667","last_updated":"2025-05-27T09:39:47Z","snapshot_observed_at":"2026-08-15T02:30:25.857561Z","submitted_at":"2025-05-23T09:31:55Z","title":"QwenLong-L1: Towards Long-Context Large Reasoning Models with Reinforcement Learning","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T14:47:55.241433Z"},"links":{"citing_paper":"/paper/2505.17667"},"observation_digest":"sha256:14229da8b080af39f96486d9a09e6e5f744f5ab2b663f1a15dca025cf3d2e395","observation_id":"eea31d13-f54a-4447-b04b-bdea4d8d786e","resolution":{"observed_at":"2026-08-07T14:47:55.241433Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16720","last_updated":"2026-04-30T02:46:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-21T18:04:31Z","title":"OpenAI o1 System Card","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.16720","snapshot_observed_at":"2026-08-07T14:47:55.301210Z","title":"Openai o1 system card","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.17667","last_updated":"2025-05-27T09:39:47Z","snapshot_observed_at":"2026-08-15T02:30:25.857561Z","submitted_at":"2025-05-23T09:31:55Z","title":"QwenLong-L1: Towards Long-Context Large Reasoning Models with Reinforcement Learning","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T14:47:55.301210Z"},"links":{"cited_paper":"/paper/2412.16720","citing_paper":"/paper/2505.17667"},"observation_digest":"sha256:d70ffbc7cdec57a44711035f86433510dd4d96a488b0f7d65824c9d3b7b6d782","observation_id":"921fe487-7fff-4a7b-9e4d-dd87a0991bb0","resolution":{"observed_at":"2026-08-07T14:47:55.301210Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.09516","last_updated":"2025-08-05T19:08:38Z","snapshot_observed_at":"2026-08-15T13:17:00.526689Z","submitted_at":"2025-03-12T16:26:39Z","title":"Search-R1: Training LLMs to Reason and Leverage Search Engines with Reinforcement Learning","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.09516","snapshot_observed_at":"2026-08-07T14:47:55.375344Z","title":"Search-r1: Training llms to reason and leverage search engines with reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.17667","last_updated":"2025-05-27T09:39:47Z","snapshot_observed_at":"2026-08-15T02:30:25.857561Z","submitted_at":"2025-05-23T09:31:55Z","title":"QwenLong-L1: Towards Long-Context Large Reasoning Models with Reinforcement Learning","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T14:47:55.375344Z"},"links":{"cited_paper":"/paper/2503.09516","citing_paper":"/paper/2505.17667"},"observation_digest":"sha256:7f98e5408bdc17e3c2968743195dede7be91bb3dcd085083342e664526f06662","observation_id":"ad90fe84-00f5-444b-b5b8-99ee3c97fe0c","resolution":{"observed_at":"2026-08-07T14:47:55.375344Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:47:55.450413Z","title":"The narrativeqa reading comprehension challenge","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.17667","last_updated":"2025-05-27T09:39:47Z","snapshot_observed_at":"2026-08-15T02:30:25.857561Z","submitted_at":"2025-05-23T09:31:55Z","title":"QwenLong-L1: Towards Long-Context Large Reasoning Models with Reinforcement Learning","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T14:47:55.450413Z"},"links":{"citing_paper":"/paper/2505.17667"},"observation_digest":"sha256:59788ffaf80961e870f611d87748fe0383459687ecbc0582c5e18cc5157aeb11","observation_id":"1947ad9c-5449-4368-a48d-3c3da885c057","resolution":{"observed_at":"2026-08-07T14:47:55.450413Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12941","last_updated":"2025-01-24T19:23:15Z","snapshot_observed_at":"2026-08-16T13:17:06.003567Z","submitted_at":"2024-09-19T17:52:07Z","title":"Fact, Fetch, and Reason: A Unified Evaluation of Retrieval-Augmented Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12941","snapshot_observed_at":"2026-08-07T14:47:55.502010Z","title":"Fact, fetch, and reason: A unified evaluation of retrieval-augmented generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.17667","last_updated":"2025-05-27T09:39:47Z","snapshot_observed_at":"2026-08-15T02:30:25.857561Z","submitted_at":"2025-05-23T09:31:55Z","title":"QwenLong-L1: Towards Long-Context Large Reasoning Models with Reinforcement Learning","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T14:47:55.502010Z"},"links":{"cited_paper":"/paper/2409.12941","citing_paper":"/paper/2505.17667"},"observation_digest":"sha256:271ccf8c9a94811c6ff026e4482a22b452d55596fda88252a09ebd947eb2217d","observation_id":"ba0e791c-8210-4b33-b1f6-9fe334c8d8d3","resolution":{"observed_at":"2026-08-07T14:47:55.502010Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:48:03.312529Z","title":"From quantity to quality: Boosting llm performance with self- guided data selection for instruction tuning","venue":null,"work_id":"aa6533e1-f31c-4953-84a6-c3e0190e8485","year":2024},"citing_paper":{"arxiv_id":"2505.17667","last_updated":"2025-05-27T09:39:47Z","snapshot_observed_at":"2026-08-15T02:30:25.857561Z","submitted_at":"2025-05-23T09:31:55Z","title":"QwenLong-L1: Towards Long-Context Large Reasoning Models with Reinforcement Learning","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T14:47:55.546278Z"},"links":{"citing_paper":"/paper/2505.17667"},"observation_digest":"sha256:4a2fdd81ddac558b2e73a0f0f725e98b46661e7a96b969d5ab988dc5092bf638","observation_id":"0c3a635d-f495-4a84-93f9-e0578ea83ab5","resolution":{"observed_at":"2026-08-07T14:48:03.394518Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:48:03.118052Z","title":"The unlocking spell on base llms: Rethinking alignment via in-context learning","venue":null,"work_id":"2e0bb78d-9e40-427a-962b-a605c4db23dd","year":2023},"citing_paper":{"arxiv_id":"2505.17667","last_updated":"2025-05-27T09:39:47Z","snapshot_observed_at":"2026-08-15T02:30:25.857561Z","submitted_at":"2025-05-23T09:31:55Z","title":"QwenLong-L1: Towards Long-Context Large Reasoning Models with Reinforcement Learning","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T14:47:55.637448Z"},"links":{"citing_paper":"/paper/2505.17667"},"observation_digest":"sha256:27de79d23d7f7b4121127b34ccb33212acce93ecb873ff5275d2ec17671f0bc1","observation_id":"8a195b50-4509-4525-9d5e-244ecf2c38d2","resolution":{"observed_at":"2026-08-07T14:48:03.197931Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.19437","last_updated":"2025-02-18T17:26:38Z","snapshot_observed_at":"2026-08-15T17:27:11.980940Z","submitted_at":"2024-12-27T04:03:16Z","title":"DeepSeek-V3 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.19437","snapshot_observed_at":"2026-08-07T14:47:55.693830Z","title":"Deepseek-v3 technical report","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.17667","last_updated":"2025-05-27T09:39:47Z","snapshot_observed_at":"2026-08-15T02:30:25.857561Z","submitted_at":"2025-05-23T09:31:55Z","title":"QwenLong-L1: Towards Long-Context Large Reasoning Models with Reinforcement Learning","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T14:47:55.693830Z"},"links":{"cited_paper":"/paper/2412.19437","citing_paper":"/paper/2505.17667"},"observation_digest":"sha256:836b095123dc375c3dc68f7381d3a5b9898d873cf2d0fed8bcc84b6a369dd08c","observation_id":"d3c2ef07-9e66-4961-9b0b-8b5bf28a5099","resolution":{"observed_at":"2026-08-07T14:47:55.693830Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:47:55.774087Z","title":"A comprehensive survey on long context language modeling","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.17667","last_updated":"2025-05-27T09:39:47Z","snapshot_observed_at":"2026-08-15T02:30:25.857561Z","submitted_at":"2025-05-23T09:31:55Z","title":"QwenLong-L1: Towards Long-Context Large Reasoning Models with Reinforcement Learning","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T14:47:55.774087Z"},"links":{"citing_paper":"/paper/2505.17667"},"observation_digest":"sha256:61e81b62b234118cee2c520aa685fef7cce5ec7992525aee72468e23bddd584b","observation_id":"bee67213-7a99-47aa-8682-d01960789dbf","resolution":{"observed_at":"2026-08-07T14:47:55.774087Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20783","last_updated":"2025-10-06T09:30:03Z","snapshot_observed_at":"2026-08-13T12:34:54.476684Z","submitted_at":"2025-03-26T17:59:14Z","title":"Understanding R1-Zero-Like Training: A Critical Perspective","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.20783","snapshot_observed_at":"2026-08-07T14:47:55.813222Z","title":"Understanding r1-zero-like training: A critical perspective","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.17667","last_updated":"2025-05-27T09:39:47Z","snapshot_observed_at":"2026-08-15T02:30:25.857561Z","submitted_at":"2025-05-23T09:31:55Z","title":"QwenLong-L1: Towards Long-Context Large Reasoning Models with Reinforcement Learning","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T14:47:55.813222Z"},"links":{"cited_paper":"/paper/2503.20783","citing_paper":"/paper/2505.17667"},"observation_digest":"sha256:ff66d973e2b20bac4df276aee5f479354659abd968d1b101623eb92cdc74ccf9","observation_id":"35645a35-7a41-449a-bae3-8555332e4569","resolution":{"observed_at":"2026-08-07T14:47:55.813222Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:48:02.913660Z","title":"Tang, Manan Roongta, Colin Cai, Jeffrey Luo, Tianjun Zhang, Li Erran Li, Raluca Ada Popa, and Ion Stoica","venue":null,"work_id":"2fbfe4d1-cb4c-4637-b2a5-9e55f24b24c0","year":2025},"citing_paper":{"arxiv_id":"2505.17667","last_updated":"2025-05-27T09:39:47Z","snapshot_observed_at":"2026-08-15T02:30:25.857561Z","submitted_at":"2025-05-23T09:31:55Z","title":"QwenLong-L1: Towards Long-Context Large Reasoning Models with Reinforcement Learning","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T14:47:55.885862Z"},"links":{"citing_paper":"/paper/2505.17667"},"observation_digest":"sha256:ef72909e6da71cbf906bbf1153765b0171164f70e9cad19e01aee9b029631f5f","observation_id":"d4991f24-b25a-4657-a3fc-dc21deb99386","resolution":{"observed_at":"2026-08-07T14:48:03.003415Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.19393","last_updated":"2025-03-01T06:07:39Z","snapshot_observed_at":"2026-08-17T11:00:39.333660Z","submitted_at":"2025-01-31T18:48:08Z","title":"s1: Simple test-time scaling","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.19393","snapshot_observed_at":"2026-08-07T14:47:55.954302Z","title":"s1: Simple test-time scaling","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.17667","last_updated":"2025-05-27T09:39:47Z","snapshot_observed_at":"2026-08-15T02:30:25.857561Z","submitted_at":"2025-05-23T09:31:55Z","title":"QwenLong-L1: Towards Long-Context Large Reasoning Models with Reinforcement Learning","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T14:47:55.954302Z"},"links":{"cited_paper":"/paper/2501.19393","citing_paper":"/paper/2505.17667"},"observation_digest":"sha256:ce8ef25702cc77246a4a9424c310a7a7e4bc09ca6f4ec9668a65bcb460fdc73f","observation_id":"c693e4ac-101f-4d0b-9120-f05c5ed32ef5","resolution":{"observed_at":"2026-08-07T14:47:55.954302Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:48:02.774473Z","title":"Learning to reason with llms, September 2024","venue":null,"work_id":"40822682-9045-4312-a63a-fe1aac9cec17","year":2024},"citing_paper":{"arxiv_id":"2505.17667","last_updated":"2025-05-27T09:39:47Z","snapshot_observed_at":"2026-08-15T02:30:25.857561Z","submitted_at":"2025-05-23T09:31:55Z","title":"QwenLong-L1: Towards Long-Context Large Reasoning Models with Reinforcement Learning","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T14:47:55.988945Z"},"links":{"citing_paper":"/paper/2505.17667"},"observation_digest":"sha256:f35358286f40803d653517dd185db4bc64c51755c6b2c21974bb39792c20af15","observation_id":"9bfba96c-05b1-46ab-9419-19da37f515f1","resolution":{"observed_at":"2026-08-07T14:48:02.850468Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:48:02.556645Z","title":"Introducing deep research, February 2025","venue":null,"work_id":"ebf5b9f4-ea88-456a-af20-f1c018a436fe","year":2025},"citing_paper":{"arxiv_id":"2505.17667","last_updated":"2025-05-27T09:39:47Z","snapshot_observed_at":"2026-08-15T02:30:25.857561Z","submitted_at":"2025-05-23T09:31:55Z","title":"QwenLong-L1: Towards Long-Context Large Reasoning Models with Reinforcement Learning","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T14:47:56.027224Z"},"links":{"citing_paper":"/paper/2505.17667"},"observation_digest":"sha256:d65c1ed34767340c50085910c1fdc9148773f646a720fb11395678ebe9c9c600","observation_id":"3ccb6168-1768-4eed-97fd-f2548393fea0","resolution":{"observed_at":"2026-08-07T14:48:02.652281Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:48:02.377820Z","title":"Openai o3-mini system card, January 2025","venue":null,"work_id":"b3020ca2-7be5-45a8-bfea-009d50ec4de3","year":2025},"citing_paper":{"arxiv_id":"2505.17667","last_updated":"2025-05-27T09:39:47Z","snapshot_observed_at":"2026-08-15T02:30:25.857561Z","submitted_at":"2025-05-23T09:31:55Z","title":"QwenLong-L1: Towards Long-Context Large Reasoning Models with Reinforcement Learning","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T14:47:56.084078Z"},"links":{"citing_paper":"/paper/2505.17667"},"observation_digest":"sha256:d2bad23113eb72f123e96e13dca2f70438c7ce4a5e5e2dd9b5e96b5a0f46074e","observation_id":"9f07ac99-fddc-4d2a-8db4-0fa1168e53ee","resolution":{"observed_at":"2026-08-07T14:48:02.469980Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:48:02.224246Z","title":"Tinyzero: Clean, minimal, accessible reproduction of deepseek r1-zero, Janurary 2025","venue":null,"work_id":"e982ae9d-725e-4ec5-815a-68ad1eb0ca1a","year":2025},"citing_paper":{"arxiv_id":"2505.17667","last_updated":"2025-05-27T09:39:47Z","snapshot_observed_at":"2026-08-15T02:30:25.857561Z","submitted_at":"2025-05-23T09:31:55Z","title":"QwenLong-L1: Towards Long-Context Large Reasoning Models with Reinforcement Learning","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T14:47:56.128326Z"},"links":{"citing_paper":"/paper/2505.17667"},"observation_digest":"sha256:f496a42f58459208234fdc77c638349dd82d9bcaaaf3e0c29b8efa5b89a0ba2e","observation_id":"3927f977-7b70-432c-8e69-c6e25b9015d2","resolution":{"observed_at":"2026-08-07T14:48:02.269767Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:47:56.194579Z","title":"In-context retrieval-augmented language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.17667","last_updated":"2025-05-27T09:39:47Z","snapshot_observed_at":"2026-08-15T02:30:25.857561Z","submitted_at":"2025-05-23T09:31:55Z","title":"QwenLong-L1: Towards Long-Context Large Reasoning Models with Reinforcement Learning","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T14:47:56.194579Z"},"links":{"citing_paper":"/paper/2505.17667"},"observation_digest":"sha256:4f38bf037a116fb796b95fe625fdf79f33edef474783b9e08704bd0a8c5ed4d8","observation_id":"fd97e77d-61a8-4e78-9536-d4a81f9f505c","resolution":{"observed_at":"2026-08-07T14:47:56.194579Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1506.02438","last_updated":"2018-10-20T18:55:07Z","snapshot_observed_at":"2026-08-15T05:06:05.489107Z","submitted_at":"2015-06-08T11:12:48Z","title":"High-Dimensional Continuous Control Using Generalized Advantage Estimation","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1506.02438","snapshot_observed_at":"2026-08-07T14:47:56.270125Z","title":"High- dimensional continuous control using generalized advantage estimation","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2505.17667","last_updated":"2025-05-27T09:39:47Z","snapshot_observed_at":"2026-08-15T02:30:25.857561Z","submitted_at":"2025-05-23T09:31:55Z","title":"QwenLong-L1: Towards Long-Context Large Reasoning Models with Reinforcement Learning","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T14:47:56.270125Z"},"links":{"cited_paper":"/paper/1506.02438","citing_paper":"/paper/2505.17667"},"observation_digest":"sha256:f1a20702a8634574f0e3fe01d7641e143cef1338bd88712ab8b2379e6c23a972","observation_id":"8747f35d-13d6-4bb5-acc9-a7750adfb6cf","resolution":{"observed_at":"2026-08-07T14:47:56.270125Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1704.06440","last_updated":"2018-10-14T22:54:38Z","snapshot_observed_at":"2026-08-14T21:05:37.779686Z","submitted_at":"2017-04-21T08:33:59Z","title":"Equivalence Between Policy Gradients and Soft Q-Learning","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1704.06440","snapshot_observed_at":"2026-08-07T14:47:56.330384Z","title":"Equivalence between policy gradients and soft q-learning","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.17667","last_updated":"2025-05-27T09:39:47Z","snapshot_observed_at":"2026-08-15T02:30:25.857561Z","submitted_at":"2025-05-23T09:31:55Z","title":"QwenLong-L1: Towards Long-Context Large Reasoning Models with Reinforcement Learning","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T14:47:56.330384Z"},"links":{"cited_paper":"/paper/1704.06440","citing_paper":"/paper/2505.17667"},"observation_digest":"sha256:c35828824b9da79b19479ea7714d314f7fa90459eb64638e42e9440baa7f597a","observation_id":"86e6ef85-53f6-4a39-b12b-e47400314f6b","resolution":{"observed_at":"2026-08-07T14:47:56.330384Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-08-15T20:26:32.102285Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-07T14:47:56.395201Z","title":"Proximal policy optimization algorithms","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.17667","last_updated":"2025-05-27T09:39:47Z","snapshot_observed_at":"2026-08-15T02:30:25.857561Z","submitted_at":"2025-05-23T09:31:55Z","title":"QwenLong-L1: Towards Long-Context Large Reasoning Models with Reinforcement Learning","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T14:47:56.395201Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2505.17667"},"observation_digest":"sha256:6e5f8dff86756445e37827aebca571cd103dd6ba8b862acd9902320a9e78a6e7","observation_id":"c1cceeef-07a9-4641-b23c-6f4a9cfadceb","resolution":{"observed_at":"2026-08-07T14:47:56.395201Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-07T14:47:56.433924Z","title":"Deepseekmath: Pushing the limits of mathematical reasoning in open language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.17667","last_updated":"2025-05-27T09:39:47Z","snapshot_observed_at":"2026-08-15T02:30:25.857561Z","submitted_at":"2025-05-23T09:31:55Z","title":"QwenLong-L1: Towards Long-Context Large Reasoning Models with Reinforcement Learning","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T14:47:56.433924Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2505.17667"},"observation_digest":"sha256:ebcdae8daa211dcf6edd51d8a470dfa4e93494f2f6507b8616738eb31000db8e","observation_id":"7dc88da3-2d69-4ee0-ba0b-79fc4edee777","resolution":{"observed_at":"2026-08-07T14:47:56.433924Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:47:56.480607Z","title":"Defining and characterizing reward gaming","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.17667","last_updated":"2025-05-27T09:39:47Z","snapshot_observed_at":"2026-08-15T02:30:25.857561Z","submitted_at":"2025-05-23T09:31:55Z","title":"QwenLong-L1: Towards Long-Context Large Reasoning Models with Reinforcement Learning","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T14:47:56.480607Z"},"links":{"citing_paper":"/paper/2505.17667"},"observation_digest":"sha256:e1f567bde4d28ccf25eafbd4c80157bd46c8b43bfa0cceb7be9ea2b2fa57fd73","observation_id":"6f5925a4-045a-4a55-8e01-e68cd626353a","resolution":{"observed_at":"2026-08-07T14:47:56.480607Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:48:02.006310Z","title":"Multihop-rag: Benchmarking retrieval-augmented generation for multi-hop queries","venue":null,"work_id":"c2fa219c-0c4b-452f-9997-6e4b7ed4ef91","year":2024},"citing_paper":{"arxiv_id":"2505.17667","last_updated":"2025-05-27T09:39:47Z","snapshot_observed_at":"2026-08-15T02:30:25.857561Z","submitted_at":"2025-05-23T09:31:55Z","title":"QwenLong-L1: Towards Long-Context Large Reasoning Models with Reinforcement Learning","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T14:47:56.488150Z"},"links":{"citing_paper":"/paper/2505.17667"},"observation_digest":"sha256:23bf8d77f067e64691340a5d38a2a4f0fbce5d192a8ca6791e6058e6e297bd11","observation_id":"6e84b73d-ea36-4c11-ad42-f9bbcf2091de","resolution":{"observed_at":"2026-08-07T14:48:02.108745Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:48:01.896993Z","title":"Gemini 2.0 flash thinking, December 2024","venue":null,"work_id":"a7f72cf8-f9ce-4c67-8b32-12cf4bcd0529","year":2024},"citing_paper":{"arxiv_id":"2505.17667","last_updated":"2025-05-27T09:39:47Z","snapshot_observed_at":"2026-08-15T02:30:25.857561Z","submitted_at":"2025-05-23T09:31:55Z","title":"QwenLong-L1: Towards Long-Context Large Reasoning Models with Reinforcement Learning","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T14:47:56.582817Z"},"links":{"citing_paper":"/paper/2505.17667"},"observation_digest":"sha256:0819cd79f800bb5f9ceba5e3fd10b4f10fde7fb5811e4002af23b9ef19da8861","observation_id":"9818ed07-8b4e-4ff3-b356-dd225e445b1c","resolution":{"observed_at":"2026-08-07T14:48:01.935285Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:48:01.702966Z","title":"Try deep research and our new experimental model in gemini, your ai assistant, December 2024","venue":null,"work_id":"1e88c385-514c-4834-99b7-1833319a96ae","year":2024},"citing_paper":{"arxiv_id":"2505.17667","last_updated":"2025-05-27T09:39:47Z","snapshot_observed_at":"2026-08-15T02:30:25.857561Z","submitted_at":"2025-05-23T09:31:55Z","title":"QwenLong-L1: Towards Long-Context Large Reasoning Models with Reinforcement Learning","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T14:47:56.804958Z"},"links":{"citing_paper":"/paper/2505.17667"},"observation_digest":"sha256:6943e60af30550f695d5597016865b3e907ab5885edfb0186396f743f9dcbf20","observation_id":"968e510e-3a68-492e-8913-8f473198698e","resolution":{"observed_at":"2026-08-07T14:48:01.794465Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:48:01.599723Z","title":"Unlocking the potential of reinforcement learning in improving reasoning models, Feburary 2025","venue":null,"work_id":"fe0e2bb0-dfad-48aa-9102-07ee556567c8","year":2025},"citing_paper":{"arxiv_id":"2505.17667","last_updated":"2025-05-27T09:39:47Z","snapshot_observed_at":"2026-08-15T02:30:25.857561Z","submitted_at":"2025-05-23T09:31:55Z","title":"QwenLong-L1: Towards Long-Context Large Reasoning Models with Reinforcement Learning","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T14:47:56.977349Z"},"links":{"citing_paper":"/paper/2505.17667"},"observation_digest":"sha256:0084230c8d9befa882c351fed1dbf46210e1e6bc7554270591ab2a2dd34b954e","observation_id":"18de4cb0-00e7-4f38-acc4-d36a3dd35d13","resolution":{"observed_at":"2026-08-07T14:48:01.640372Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:48:01.448897Z","title":"Introducing perplexity deep research, February 2025","venue":null,"work_id":"5bb95d68-c9dd-404e-b269-6e15c365a290","year":2025},"citing_paper":{"arxiv_id":"2505.17667","last_updated":"2025-05-27T09:39:47Z","snapshot_observed_at":"2026-08-15T02:30:25.857561Z","submitted_at":"2025-05-23T09:31:55Z","title":"QwenLong-L1: Towards Long-Context Large Reasoning Models with Reinforcement Learning","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T14:47:57.194679Z"},"links":{"citing_paper":"/paper/2505.17667"},"observation_digest":"sha256:e17d5de25745d25b9d61be694ae507fc0a312f0fa4a8581cd4b37058197947a4","observation_id":"5af499fc-4208-4031-a3fc-e6890f0434cf","resolution":{"observed_at":"2026-08-07T14:48:01.519489Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:47:57.355705Z","title":"Qwq: Reflect deeply on the boundaries of the unknown, November 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.17667","last_updated":"2025-05-27T09:39:47Z","snapshot_observed_at":"2026-08-15T02:30:25.857561Z","submitted_at":"2025-05-23T09:31:55Z","title":"QwenLong-L1: Towards Long-Context Large Reasoning Models with Reinforcement Learning","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T14:47:57.355705Z"},"links":{"citing_paper":"/paper/2505.17667"},"observation_digest":"sha256:bfa9b2345798e11c5d201eb2713d52c8d2a6f85c147bd16279ca8d1221d80e63","observation_id":"f0836f6c-480a-4a5d-84a6-8255c3886505","resolution":{"observed_at":"2026-08-07T14:47:57.355705Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:47:57.604942Z","title":"Qwen3: Think deeper, act faster, April 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.17667","last_updated":"2025-05-27T09:39:47Z","snapshot_observed_at":"2026-08-15T02:30:25.857561Z","submitted_at":"2025-05-23T09:31:55Z","title":"QwenLong-L1: Towards Long-Context Large Reasoning Models with Reinforcement Learning","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T14:47:57.604942Z"},"links":{"citing_paper":"/paper/2505.17667"},"observation_digest":"sha256:ec8d2bfb577f606620ac5d4f3339770e6dd26a10cc61606ce954b5b5c2a01271","observation_id":"affe8d92-c044-42e4-b242-76e2a097a1c1","resolution":{"observed_at":"2026-08-07T14:47:57.604942Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:47:57.786971Z","title":"Qwq-32b: Embracing the power of reinforcement learning, March 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.17667","last_updated":"2025-05-27T09:39:47Z","snapshot_observed_at":"2026-08-15T02:30:25.857561Z","submitted_at":"2025-05-23T09:31:55Z","title":"QwenLong-L1: Towards Long-Context Large Reasoning Models with Reinforcement Learning","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T14:47:57.786971Z"},"links":{"citing_paper":"/paper/2505.17667"},"observation_digest":"sha256:deae36abe2dca673c424d7fb45b788ba629a7fb0093a72817805a7e8ae5f923c","observation_id":"6fe7b7b6-69f2-4bc4-9acd-954aedd08ca0","resolution":{"observed_at":"2026-08-07T14:47:57.786971Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:47:57.926741Z","title":"Musique: Multihop questions via single-hop question composition","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.17667","last_updated":"2025-05-27T09:39:47Z","snapshot_observed_at":"2026-08-15T02:30:25.857561Z","submitted_at":"2025-05-23T09:31:55Z","title":"QwenLong-L1: Towards Long-Context Large Reasoning Models with Reinforcement Learning","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T14:47:57.926741Z"},"links":{"citing_paper":"/paper/2505.17667"},"observation_digest":"sha256:2204f11703d96724d160c5c5cccd98ea9bfa24e32113bdb4824ee91b200054d5","observation_id":"4c15f17e-4a72-4d80-9006-0108a4394cd8","resolution":{"observed_at":"2026-08-07T14:47:57.926741Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.10460","last_updated":"2025-05-28T12:32:29Z","snapshot_observed_at":"2026-08-16T12:50:20.333530Z","submitted_at":"2025-03-13T15:29:22Z","title":"Light-R1: Curriculum SFT, DPO and RL for Long COT from Scratch and Beyond","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.10460","snapshot_observed_at":"2026-08-07T14:47:58.110674Z","title":"Light-r1: Curriculum sft, dpo and rl for long cot from scratch and beyond","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.17667","last_updated":"2025-05-27T09:39:47Z","snapshot_observed_at":"2026-08-15T02:30:25.857561Z","submitted_at":"2025-05-23T09:31:55Z","title":"QwenLong-L1: Towards Long-Context Large Reasoning Models with Reinforcement Learning","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T14:47:58.110674Z"},"links":{"cited_paper":"/paper/2503.10460","citing_paper":"/paper/2505.17667"},"observation_digest":"sha256:125af1517fe8974f9e7eb4f530f21438f5535ebe796c988a04387371d509eed9","observation_id":"9b3a869c-772d-4d03-b820-8926f46311ae","resolution":{"observed_at":"2026-08-07T14:47:58.110674Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.13639","last_updated":"2024-10-22T22:05:16Z","snapshot_observed_at":"2026-08-16T20:55:28.800635Z","submitted_at":"2024-10-17T15:09:03Z","title":"A Comparative Study on Reasoning Patterns of OpenAI's o1 Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.13639","snapshot_observed_at":"2026-08-07T14:47:58.227150Z","title":"A comparative study on reasoning patterns of openai’s o1 model","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.17667","last_updated":"2025-05-27T09:39:47Z","snapshot_observed_at":"2026-08-15T02:30:25.857561Z","submitted_at":"2025-05-23T09:31:55Z","title":"QwenLong-L1: Towards Long-Context Large Reasoning Models with Reinforcement Learning","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T14:47:58.227150Z"},"links":{"cited_paper":"/paper/2410.13639","citing_paper":"/paper/2505.17667"},"observation_digest":"sha256:ba09f301e99d1b44235fdf69e3c244ef76b3935c8270ebc51ab5a4975cb3fb9e","observation_id":"413f453b-55d9-49b4-9e26-7dcb2f9329b8","resolution":{"observed_at":"2026-08-07T14:47:58.227150Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.14768","last_updated":"2025-02-20T17:49:26Z","snapshot_observed_at":"2026-08-15T06:02:45.207770Z","submitted_at":"2025-02-20T17:49:26Z","title":"Logic-RL: Unleashing LLM Reasoning with Rule-Based Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.14768","snapshot_observed_at":"2026-08-07T14:47:58.340088Z","title":"Logic-rl: Unleashing llm reasoning with rule-based reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.17667","last_updated":"2025-05-27T09:39:47Z","snapshot_observed_at":"2026-08-15T02:30:25.857561Z","submitted_at":"2025-05-23T09:31:55Z","title":"QwenLong-L1: Towards Long-Context Large Reasoning Models with Reinforcement Learning","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T14:47:58.340088Z"},"links":{"cited_paper":"/paper/2502.14768","citing_paper":"/paper/2505.17667"},"observation_digest":"sha256:eae1dc431579562a3065c59068b2f1c80cf2798721cfee7ceb37f762266153a5","observation_id":"ff648891-44b4-41c7-9ca2-2d54eee6e314","resolution":{"observed_at":"2026-08-07T14:47:58.340088Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:48:01.282913Z","title":"Effective long-context scaling of foundation models","venue":null,"work_id":"f9078227-4c09-4945-947c-0bbe37f432db","year":2024},"citing_paper":{"arxiv_id":"2505.17667","last_updated":"2025-05-27T09:39:47Z","snapshot_observed_at":"2026-08-15T02:30:25.857561Z","submitted_at":"2025-05-23T09:31:55Z","title":"QwenLong-L1: Towards Long-Context Large Reasoning Models with Reinforcement Learning","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T14:47:58.419410Z"},"links":{"citing_paper":"/paper/2505.17667"},"observation_digest":"sha256:6ee8e56ea57ed6976352ed09d2098be8720465248b30496a19e8dbd2b03bc0e9","observation_id":"3f3f1ab7-7205-4d9f-b143-57ad1e783f38","resolution":{"observed_at":"2026-08-07T14:48:01.336932Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.09686","last_updated":"2025-01-23T08:44:44Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-16T17:37:58Z","title":"Towards Large Reasoning Models: A Survey of Reinforced Reasoning with Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.09686","snapshot_observed_at":"2026-08-07T14:47:58.564817Z","title":"Towards large reasoning models: A survey of reinforced reasoning with large language models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.17667","last_updated":"2025-05-27T09:39:47Z","snapshot_observed_at":"2026-08-15T02:30:25.857561Z","submitted_at":"2025-05-23T09:31:55Z","title":"QwenLong-L1: Towards Long-Context Large Reasoning Models with Reinforcement Learning","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T14:47:58.564817Z"},"links":{"cited_paper":"/paper/2501.09686","citing_paper":"/paper/2505.17667"},"observation_digest":"sha256:9569d064df5a9c83654e4162922e5bd387dd5fd985b43edbf89fab89f798ded9","observation_id":"4191795d-4f7c-4b52-9837-1803d4e0eff9","resolution":{"observed_at":"2026-08-07T14:47:58.564817Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12122","last_updated":"2024-09-18T16:45:37Z","snapshot_observed_at":"2026-08-17T18:51:13.219936Z","submitted_at":"2024-09-18T16:45:37Z","title":"Qwen2.5-Math Technical Report: Toward Mathematical Expert Model via Self-Improvement","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12122","snapshot_observed_at":"2026-08-07T14:47:58.698401Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.17667","last_updated":"2025-05-27T09:39:47Z","snapshot_observed_at":"2026-08-15T02:30:25.857561Z","submitted_at":"2025-05-23T09:31:55Z","title":"QwenLong-L1: Towards Long-Context Large Reasoning Models with Reinforcement Learning","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T14:47:58.698401Z"},"links":{"cited_paper":"/paper/2409.12122","citing_paper":"/paper/2505.17667"},"observation_digest":"sha256:52db4e0835c7b6c39f00f08a8a0c9cffd1cbaaf4b9783f96d70877f334f66826","observation_id":"89ed0a4a-dba0-441f-9389-97d418ad9cd5","resolution":{"observed_at":"2026-08-07T14:47:58.698401Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:47:58.837526Z","title":"Hotpotqa: A dataset for diverse, explainable multi-hop question answering","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.17667","last_updated":"2025-05-27T09:39:47Z","snapshot_observed_at":"2026-08-15T02:30:25.857561Z","submitted_at":"2025-05-23T09:31:55Z","title":"QwenLong-L1: Towards Long-Context Large Reasoning Models with Reinforcement Learning","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-07T14:47:58.837526Z"},"links":{"citing_paper":"/paper/2505.17667"},"observation_digest":"sha256:d2a03aa7cb31d3d7773fa2cbf4fc3ce1d4ecd2851d7a5f1bd0745f23198fc045","observation_id":"b11d0c1e-9563-403e-b370-905692e76ce2","resolution":{"observed_at":"2026-08-07T14:47:58.837526Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:47:59.029063Z","title":"React: Synergizing reasoning and acting in language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.17667","last_updated":"2025-05-27T09:39:47Z","snapshot_observed_at":"2026-08-15T02:30:25.857561Z","submitted_at":"2025-05-23T09:31:55Z","title":"QwenLong-L1: Towards Long-Context Large Reasoning Models with Reinforcement Learning","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-07T14:47:59.029063Z"},"links":{"citing_paper":"/paper/2505.17667"},"observation_digest":"sha256:f982adc17048f513a1a38175131f1aab492b17880273a4b84f1d64ab90865a89","observation_id":"d6873614-d83d-4412-896a-aac6382cb4e6","resolution":{"observed_at":"2026-08-07T14:47:59.029063Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.03387","last_updated":"2025-07-29T16:23:02Z","snapshot_observed_at":"2026-08-08T04:13:22.884923Z","submitted_at":"2025-02-05T17:23:45Z","title":"LIMO: Less is More for Reasoning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.03387","snapshot_observed_at":"2026-08-07T14:47:59.250891Z","title":"Limo: Less is more for reasoning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.17667","last_updated":"2025-05-27T09:39:47Z","snapshot_observed_at":"2026-08-15T02:30:25.857561Z","submitted_at":"2025-05-23T09:31:55Z","title":"QwenLong-L1: Towards Long-Context Large Reasoning Models with Reinforcement Learning","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-07T14:47:59.250891Z"},"links":{"cited_paper":"/paper/2502.03387","citing_paper":"/paper/2505.17667"},"observation_digest":"sha256:cc821d143f99a234f1f305fabdeb45e87c5024a3d9f571bb36cb54692bbcdcbc","observation_id":"46851b85-18b4-449a-a820-f04a16a9e52e","resolution":{"observed_at":"2026-08-07T14:47:59.250891Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14476","last_updated":"2025-05-20T01:37:34Z","snapshot_observed_at":"2026-08-18T05:01:20.543826Z","submitted_at":"2025-03-18T17:49:06Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.14476","snapshot_observed_at":"2026-08-07T14:47:59.379000Z","title":"Dapo: An open-source llm reinforcement learning system at scale","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.17667","last_updated":"2025-05-27T09:39:47Z","snapshot_observed_at":"2026-08-15T02:30:25.857561Z","submitted_at":"2025-05-23T09:31:55Z","title":"QwenLong-L1: Towards Long-Context Large Reasoning Models with Reinforcement Learning","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-07T14:47:59.379000Z"},"links":{"cited_paper":"/paper/2503.14476","citing_paper":"/paper/2505.17667"},"observation_digest":"sha256:55b8c14db204808afcaf45fa89b93a1996fbfbc45d4e7cc4f4f2b20df79dee71","observation_id":"fd620298-cab5-4451-a2aa-84df904a8cb4","resolution":{"observed_at":"2026-08-07T14:47:59.379000Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.01491","last_updated":"2025-03-03T12:59:25Z","snapshot_observed_at":"2026-08-17T21:54:40.041335Z","submitted_at":"2025-03-03T12:59:25Z","title":"What's Behind PPO's Collapse in Long-CoT? Value Optimization Holds the Secret","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.01491","snapshot_observed_at":"2026-08-07T14:47:59.582127Z","title":"What’s behind ppo’s collapse in long-cot? value optimization holds the secret","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.17667","last_updated":"2025-05-27T09:39:47Z","snapshot_observed_at":"2026-08-15T02:30:25.857561Z","submitted_at":"2025-05-23T09:31:55Z","title":"QwenLong-L1: Towards Long-Context Large Reasoning Models with Reinforcement Learning","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-07T14:47:59.582127Z"},"links":{"cited_paper":"/paper/2503.01491","citing_paper":"/paper/2505.17667"},"observation_digest":"sha256:9390131d774854ef076cecf09571a82a77ba545976d759bc671bab06c721bdb4","observation_id":"30caf4b3-60a0-444d-8f18-cbce39e87a96","resolution":{"observed_at":"2026-08-07T14:47:59.582127Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.18892","last_updated":"2025-08-06T08:42:32Z","snapshot_observed_at":"2026-07-06T20:57:57.039376Z","submitted_at":"2025-03-24T17:06:10Z","title":"SimpleRL-Zoo: Investigating and Taming Zero Reinforcement Learning for Open Base Models in the Wild","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.18892","snapshot_observed_at":"2026-08-07T14:47:59.741379Z","title":"Simplerl-zoo: Investigating and taming zero reinforcement learning for open base models in the wild","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.17667","last_updated":"2025-05-27T09:39:47Z","snapshot_observed_at":"2026-08-15T02:30:25.857561Z","submitted_at":"2025-05-23T09:31:55Z","title":"QwenLong-L1: Towards Long-Context Large Reasoning Models with Reinforcement Learning","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-07T14:47:59.741379Z"},"links":{"cited_paper":"/paper/2503.18892","citing_paper":"/paper/2505.17667"},"observation_digest":"sha256:0cbc570b33f24ce2310cb81134f61255916cb64408110f8ef70a383a0d932aaa","observation_id":"9ae0d5af-1f74-45e2-a223-e20895d4876f","resolution":{"observed_at":"2026-08-07T14:47:59.741379Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:48:01.108768Z","title":"Docmath-eval: Evaluating math reasoning capabilities of llms in understanding long and specialized documents","venue":null,"work_id":"371a06d0-9cb4-4d46-b31e-03244dc163d4","year":2024},"citing_paper":{"arxiv_id":"2505.17667","last_updated":"2025-05-27T09:39:47Z","snapshot_observed_at":"2026-08-15T02:30:25.857561Z","submitted_at":"2025-05-23T09:31:55Z","title":"QwenLong-L1: Towards Long-Context Large Reasoning Models with Reinforcement Learning","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-07T14:47:59.889395Z"},"links":{"citing_paper":"/paper/2505.17667"},"observation_digest":"sha256:e45cdde97a01eb0395a5982fbcbd6245045be945183a828c3450166a09b65035","observation_id":"6bfde056-f405-44df-87e7-d97d9a19bdc3","resolution":{"observed_at":"2026-08-07T14:48:01.159664Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:48:00.020817Z","title":"Judging llm-as-a-judge with mt-bench and chatbot arena","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.17667","last_updated":"2025-05-27T09:39:47Z","snapshot_observed_at":"2026-08-15T02:30:25.857561Z","submitted_at":"2025-05-23T09:31:55Z","title":"QwenLong-L1: Towards Long-Context Large Reasoning Models with Reinforcement Learning","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-07T14:48:00.020817Z"},"links":{"citing_paper":"/paper/2505.17667"},"observation_digest":"sha256:850bb09d470fd802943b0b61da0a2ad7c58df127b20bb6093b0875b8b93b2458","observation_id":"f1041c25-8c63-4478-a8a1-19c0df1792a5","resolution":{"observed_at":"2026-08-07T14:48:00.020817Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:48:00.941544Z","title":"Lima: Less is more for alignment","venue":null,"work_id":"cef8a772-4e5f-459c-950d-35eb3c82ed59","year":2023},"citing_paper":{"arxiv_id":"2505.17667","last_updated":"2025-05-27T09:39:47Z","snapshot_observed_at":"2026-08-15T02:30:25.857561Z","submitted_at":"2025-05-23T09:31:55Z","title":"QwenLong-L1: Towards Long-Context Large Reasoning Models with Reinforcement Learning","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-07T14:48:00.129155Z"},"links":{"citing_paper":"/paper/2505.17667"},"observation_digest":"sha256:faf2b5882a39e4b01eb5df18a72236fe82b3f89d5bd582b0220ed73817f0f9a8","observation_id":"42577c6c-3348-41c1-818b-8500d531da8f","resolution":{"observed_at":"2026-08-07T14:48:01.030781Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2505.17667","last_updated":"2025-05-27T09:39:47Z","latest_version":2,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-15T02:30:25.857561Z","submitted_at":"2025-05-23T09:31:55Z","title":"QwenLong-L1: Towards Long-Context Large Reasoning Models with Reinforcement Learning"},"reference_resolution":{"displayed":59,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":40,"verified_exact":0,"verified_fuzzy":19},"total_outbound_references":59},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"thesis":"As of 18 August 2026, this Paper Citation Record lists 59 of 59 outbound references and 17 inbound Pith citation observations for arXiv:2505.17667."}