{"as_of":"2026-08-10T11:32:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:94ae087ad66eebe88fd9a03f2a0d0ba397c2ea8fb610487d2050d742020e86d2","coverage":[{"denominator":44,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":44,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T10:54:30.541560Z","state":"measured"},{"denominator":58,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":58,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":14,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":14,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T21:12:12.793725Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T06:19:38.663842Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.04185","last_updated":"2025-06-04T17:29:22Z","snapshot_observed_at":"2026-08-09T13:15:04.057332Z","submitted_at":"2025-06-04T17:29:22Z","title":"R-Search: Empowering LLM Reasoning with Search via Multi-Reward Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.04185","snapshot_observed_at":"2026-08-05T21:12:12.793725Z","title":"R-search: Empowering llm reasoning with search via multi-reward reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.09303","last_updated":"2025-08-12T19:38:21Z","snapshot_observed_at":"2026-08-07T12:04:31.853290Z","submitted_at":"2025-08-12T19:38:21Z","title":"ParallelSearch: Train your LLMs to Decompose Query and Search Sub-queries in Parallel with Reinforcement Learning","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-05T21:12:12.793725Z"},"links":{"cited_paper":"/paper/2506.04185","citing_paper":"/paper/2508.09303"},"observation_digest":"sha256:52fddf8b05252fdd1c7c3f135854a717044cba876e1f3c4224f4557e925880aa","observation_id":"a035ada7-ce11-4bbb-8836-820e9b7b309f","resolution":{"observed_at":"2026-08-05T21:12:12.793725Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.04185","last_updated":"2025-06-04T17:29:22Z","snapshot_observed_at":"2026-08-09T13:15:04.057332Z","submitted_at":"2025-06-04T17:29:22Z","title":"R-Search: Empowering LLM Reasoning with Search via Multi-Reward Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2506.04185","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.04185","snapshot_observed_at":"2026-07-04T06:19:38.663842Z","title":"R-search: Em- powering llm reasoning with search via multi-reward reinforcement learning","venue":null,"work_id":"6cbb2815-00cc-4d21-be56-367f5ec33a28","year":2025},"citing_paper":{"arxiv_id":"2510.00861","last_updated":"2026-04-20T08:17:44Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-10-01T13:10:36Z","title":"Erase to Improve: Erasable Reinforcement Learning for Search-Augmented LLMs","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-18T11:06:20.058342Z"},"links":{"cited_paper":"/paper/2506.04185","citing_paper":"/paper/2510.00861"},"observation_digest":"sha256:a3d78eee3559b1ca1ba946677b0678dacc5d8e1cfcda0a1a0c15d62153533c03","observation_id":"e1aa069b-9b7b-46a1-aba8-ddf010ed2d6b","resolution":{"observed_at":"2026-05-18T11:11:18.237838Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.04185","last_updated":"2025-06-04T17:29:22Z","snapshot_observed_at":"2026-08-09T13:15:04.057332Z","submitted_at":"2025-06-04T17:29:22Z","title":"R-Search: Empowering LLM Reasoning with Search via Multi-Reward Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2506.04185","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.04185","snapshot_observed_at":"2026-07-04T06:19:38.663842Z","title":"R-search: Em- powering llm reasoning with search via multi-reward reinforcement learning","venue":null,"work_id":"6cbb2815-00cc-4d21-be56-367f5ec33a28","year":2025},"citing_paper":{"arxiv_id":"2510.11122","last_updated":"2026-04-04T06:08:34Z","snapshot_observed_at":"2026-08-06T00:49:59.952705Z","submitted_at":"2025-10-13T08:08:59Z","title":"Learning to Trust: Dynamic Utilization of Retrieval-Augmented Generation for E-commerce Search Relevance","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-18T08:06:23.479875Z"},"links":{"cited_paper":"/paper/2506.04185","citing_paper":"/paper/2510.11122"},"observation_digest":"sha256:e46205ca3e4ae03a295887f888f8cecb6d7fecfb011c0761e131565288d2490a","observation_id":"a70854fa-5586-4614-b096-b05e0ba3d765","resolution":{"observed_at":"2026-05-18T08:11:07.182204Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.04185","last_updated":"2025-06-04T17:29:22Z","snapshot_observed_at":"2026-08-09T13:15:04.057332Z","submitted_at":"2025-06-04T17:29:22Z","title":"R-Search: Empowering LLM Reasoning with Search via Multi-Reward Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.04185","snapshot_observed_at":"2026-08-04T09:50:51.764147Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.13272","last_updated":"2026-06-03T06:16:13Z","snapshot_observed_at":"2026-08-09T22:49:51.379892Z","submitted_at":"2025-10-15T08:17:52Z","title":"Beyond Correctness: Rewarding Faithful Reasoning in Retrieval-Augmented Generation","version":3},"reference_index":89,"source":"arxiv_source","source_observed_at":"2026-08-04T09:50:51.764147Z"},"links":{"cited_paper":"/paper/2506.04185","citing_paper":"/paper/2510.13272"},"observation_digest":"sha256:973b0441f43cba8391e13c5f86a675c12dc97a8dca73c176fddc5c1c77dcfb60","observation_id":"6f35d705-251a-4281-a182-3841362f4f59","resolution":{"observed_at":"2026-08-04T09:50:51.764147Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.04185","last_updated":"2025-06-04T17:29:22Z","snapshot_observed_at":"2026-08-09T13:15:04.057332Z","submitted_at":"2025-06-04T17:29:22Z","title":"R-Search: Empowering LLM Reasoning with Search via Multi-Reward Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2506.04185","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.04185","snapshot_observed_at":"2026-07-04T06:19:38.663842Z","title":"R-search: Em- powering llm reasoning with search via multi-reward reinforcement learning","venue":null,"work_id":"6cbb2815-00cc-4d21-be56-367f5ec33a28","year":2025},"citing_paper":{"arxiv_id":"2605.06285","last_updated":"2026-05-07T13:56:13Z","snapshot_observed_at":"2026-07-06T23:18:46.145104Z","submitted_at":"2026-05-07T13:56:13Z","title":"LatentRAG: Latent Reasoning and Retrieval for Efficient Agentic RAG","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-05-08T10:27:00.257353Z"},"links":{"cited_paper":"/paper/2506.04185","citing_paper":"/paper/2605.06285"},"observation_digest":"sha256:6ce0e3dda10c407832f66493cf4e670694444cacf58436e3d09d85925a083442","observation_id":"84164662-8da3-46e0-b4b5-be266237471d","resolution":{"observed_at":"2026-05-11T20:01:12.182325Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.04185","last_updated":"2025-06-04T17:29:22Z","snapshot_observed_at":"2026-08-09T13:15:04.057332Z","submitted_at":"2025-06-04T17:29:22Z","title":"R-Search: Empowering LLM Reasoning with Search via Multi-Reward Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2506.04185","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.04185","snapshot_observed_at":"2026-07-04T06:19:38.663842Z","title":"R-search: Em- powering llm reasoning with search via multi-reward reinforcement learning","venue":null,"work_id":"6cbb2815-00cc-4d21-be56-367f5ec33a28","year":2025},"citing_paper":{"arxiv_id":"2605.10923","last_updated":"2026-05-17T05:50:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-11T17:55:13Z","title":"Dynamic Skill Lifecycle Management for Agentic Reinforcement Learning","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-05-12T03:45:06.199636Z"},"links":{"cited_paper":"/paper/2506.04185","citing_paper":"/paper/2605.10923"},"observation_digest":"sha256:347c068266e56ad1734854eb17911edfa368a3abe445d12e4cc75ceb07297643","observation_id":"7f9edbd2-78df-4063-88ba-511dbfaa9a57","resolution":{"observed_at":"2026-05-12T07:06:33.516677Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.04185","last_updated":"2025-06-04T17:29:22Z","snapshot_observed_at":"2026-08-09T13:15:04.057332Z","submitted_at":"2025-06-04T17:29:22Z","title":"R-Search: Empowering LLM Reasoning with Search via Multi-Reward Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2506.04185","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.04185","snapshot_observed_at":"2026-07-04T06:19:38.663842Z","title":"R-search: Em- powering llm reasoning with search via multi-reward reinforcement learning","venue":null,"work_id":"6cbb2815-00cc-4d21-be56-367f5ec33a28","year":2025},"citing_paper":{"arxiv_id":"2605.10923","last_updated":"2026-05-17T05:50:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-11T17:55:13Z","title":"Dynamic Skill Lifecycle Management for Agentic Reinforcement Learning","version":2},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-05-20T22:19:49.016156Z"},"links":{"cited_paper":"/paper/2506.04185","citing_paper":"/paper/2605.10923"},"observation_digest":"sha256:5263a3841494a77359a4b3deac1c3840d70b4851e17e65c1c85971a0db27df09","observation_id":"a8f2398a-4187-4976-af04-f952f24d8fdf","resolution":{"observed_at":"2026-05-20T22:23:48.394171Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.04185","last_updated":"2025-06-04T17:29:22Z","snapshot_observed_at":"2026-08-09T13:15:04.057332Z","submitted_at":"2025-06-04T17:29:22Z","title":"R-Search: Empowering LLM Reasoning with Search via Multi-Reward Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2506.04185","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.04185","snapshot_observed_at":"2026-07-04T06:19:38.663842Z","title":"R-search: Em- powering llm reasoning with search via multi-reward reinforcement learning","venue":null,"work_id":"6cbb2815-00cc-4d21-be56-367f5ec33a28","year":2025},"citing_paper":{"arxiv_id":"2605.27860","last_updated":"2026-08-03T08:40:06Z","snapshot_observed_at":"2026-08-06T23:31:06.558801Z","submitted_at":"2026-05-27T02:20:21Z","title":"C-MIG: Multi-view Information Gain-based Retrieval-Augmented Generation for Clinical Diagnosis Reasoning","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-06-29T12:43:58.323948Z"},"links":{"cited_paper":"/paper/2506.04185","citing_paper":"/paper/2605.27860"},"observation_digest":"sha256:642984b264612f4085847f57812e38554d7ad0c37cf841215127e37715ff6dde","observation_id":"8c269676-9853-4254-ae24-6187fab04f09","resolution":{"observed_at":"2026-06-29T12:53:27.006970Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.04185","last_updated":"2025-06-04T17:29:22Z","snapshot_observed_at":"2026-08-09T13:15:04.057332Z","submitted_at":"2025-06-04T17:29:22Z","title":"R-Search: Empowering LLM Reasoning with Search via Multi-Reward Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.04185","snapshot_observed_at":"2026-08-04T05:01:11.073781Z","title":"Qiaoyu Zheng, Yuze Sun, Chaoyi Wu, Weike Zhao, Pengcheng Qiu, Yongguo Yu, Kun Sun, Jian Zhang, Yanfeng Wang, Ya Zhang, and 1 others","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2605.27860","last_updated":"2026-08-03T08:40:06Z","snapshot_observed_at":"2026-08-06T23:31:06.558801Z","submitted_at":"2026-05-27T02:20:21Z","title":"C-MIG: Multi-view Information Gain-based Retrieval-Augmented Generation for Clinical Diagnosis Reasoning","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-04T05:01:11.073781Z"},"links":{"cited_paper":"/paper/2506.04185","citing_paper":"/paper/2605.27860"},"observation_digest":"sha256:f0bac737282c1a7085f5ece653e7d8fda1c29a6e6dfffadf0f1f3624b667df67","observation_id":"48e413c0-87bf-409f-9bd6-e0dcad6295ec","resolution":{"observed_at":"2026-08-04T05:01:11.073781Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.04185","last_updated":"2025-06-04T17:29:22Z","snapshot_observed_at":"2026-08-09T13:15:04.057332Z","submitted_at":"2025-06-04T17:29:22Z","title":"R-Search: Empowering LLM Reasoning with Search via Multi-Reward Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2506.04185","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.04185","snapshot_observed_at":"2026-07-04T06:19:38.663842Z","title":"R-search: Em- powering llm reasoning with search via multi-reward reinforcement learning","venue":null,"work_id":"6cbb2815-00cc-4d21-be56-367f5ec33a28","year":2025},"citing_paper":{"arxiv_id":"2606.21262","last_updated":"2026-07-23T15:28:36Z","snapshot_observed_at":"2026-08-02T20:51:48.133765Z","submitted_at":"2026-06-19T09:38:02Z","title":"ARCO: Adaptive Rubrics with Co-Evolution for Multi-Step LLM-Based Agents","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-06-26T14:33:50.123077Z"},"links":{"cited_paper":"/paper/2506.04185","citing_paper":"/paper/2606.21262"},"observation_digest":"sha256:17c0e5547cab7d68e31285c166cdf8ac0c1edac0db13adca5a24044de6d6abbe","observation_id":"ff0c6177-c78e-43ad-b05b-23eb7ce5d77b","resolution":{"observed_at":"2026-07-04T06:19:38.665573Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.04185","last_updated":"2025-06-04T17:29:22Z","snapshot_observed_at":"2026-08-09T13:15:04.057332Z","submitted_at":"2025-06-04T17:29:22Z","title":"R-Search: Empowering LLM Reasoning with Search via Multi-Reward Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.04185","snapshot_observed_at":"2026-08-02T10:43:55.436888Z","title":"R-search: Empowering llm reasoning with search via multi-reward reinforcement learning.arXiv preprint arXiv:2506.04185,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.21262","last_updated":"2026-07-23T15:28:36Z","snapshot_observed_at":"2026-08-02T20:51:48.133765Z","submitted_at":"2026-06-19T09:38:02Z","title":"ARCO: Adaptive Rubrics with Co-Evolution for Multi-Step LLM-Based Agents","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-02T10:43:55.436888Z"},"links":{"cited_paper":"/paper/2506.04185","citing_paper":"/paper/2606.21262"},"observation_digest":"sha256:94b803f1fca5ccb6af1d7fb0d4f0668d1338a92117b32b7609891a1839adb56c","observation_id":"018f5e59-856c-457f-8186-0402c437d89f","resolution":{"observed_at":"2026-08-02T10:43:55.436888Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.04185","last_updated":"2025-06-04T17:29:22Z","snapshot_observed_at":"2026-08-09T13:15:04.057332Z","submitted_at":"2025-06-04T17:29:22Z","title":"R-Search: Empowering LLM Reasoning with Search via Multi-Reward Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2506.04185","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.04185","snapshot_observed_at":"2026-07-04T06:19:38.663842Z","title":"R-search: Em- powering llm reasoning with search via multi-reward reinforcement learning","venue":null,"work_id":"6cbb2815-00cc-4d21-be56-367f5ec33a28","year":2025},"citing_paper":{"arxiv_id":"2606.26122","last_updated":"2026-05-27T21:21:42Z","snapshot_observed_at":"2026-07-07T00:00:31.981360Z","submitted_at":"2026-05-27T21:21:42Z","title":"DocArena: Turning Raw Documents into Controllable Training Environments for Document Search Agents","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-06-29T12:50:16.625077Z"},"links":{"cited_paper":"/paper/2506.04185","citing_paper":"/paper/2606.26122"},"observation_digest":"sha256:93dfecbe2ae6e7d6873cee4b56669c5266d8f08dcc519b0d9fa6eaa6519a488e","observation_id":"0ee5da9b-6551-4441-a027-aeaa9de77755","resolution":{"observed_at":"2026-06-29T12:53:26.535103Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.04185","last_updated":"2025-06-04T17:29:22Z","snapshot_observed_at":"2026-08-09T13:15:04.057332Z","submitted_at":"2025-06-04T17:29:22Z","title":"R-Search: Empowering LLM Reasoning with Search via Multi-Reward Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.04185","snapshot_observed_at":"2026-08-01T13:54:23.891567Z","title":"arXiv preprint arXiv:2506.04185 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.18979","last_updated":"2026-07-21T11:14:33Z","snapshot_observed_at":"2026-08-06T13:13:54.204332Z","submitted_at":"2026-07-21T11:14:33Z","title":"Fishing Out Free Riders: Shapley-Based Reward Attribution for Parallel Reasoning via Reinforcement Learning","version":1},"reference_index":77,"source":"arxiv_source","source_observed_at":"2026-08-01T13:54:23.891567Z"},"links":{"cited_paper":"/paper/2506.04185","citing_paper":"/paper/2607.18979"},"observation_digest":"sha256:a1b1a61235505af1d3eee5e4c06cbf75830679314f4231ce6269fd2bca45a432","observation_id":"4edeba9a-bc41-4575-8bbc-4c477388e225","resolution":{"observed_at":"2026-08-01T13:54:23.891567Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.04185","last_updated":"2025-06-04T17:29:22Z","snapshot_observed_at":"2026-08-09T13:15:04.057332Z","submitted_at":"2025-06-04T17:29:22Z","title":"R-Search: Empowering LLM Reasoning with Search via Multi-Reward Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.04185","snapshot_observed_at":"2026-08-04T15:12:55.776464Z","title":"2025 , archivePrefix =","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.02097","last_updated":"2026-08-03T11:58:21Z","snapshot_observed_at":"2026-08-09T08:55:51.965628Z","submitted_at":"2026-08-03T11:58:21Z","title":"Fetch-then-Explore: Decoupling Selection from Extraction over a Persistent Workspace for Search Agents","version":1},"reference_index":104,"source":"arxiv_source","source_observed_at":"2026-08-04T15:12:55.776464Z"},"links":{"cited_paper":"/paper/2506.04185","citing_paper":"/paper/2608.02097"},"observation_digest":"sha256:becc2ab1529def1c0daa8215658757cdfa78d7b83b93a6e42cff90f3a4525ac5","observation_id":"3e83d5df-5c7a-45e8-9376-d24c1ef67354","resolution":{"observed_at":"2026-08-04T15:12:55.776464Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2506.04185/citation-record","integrity":"/paper/2506.04185/integrity","json":"/paper/2506.04185/citation-record.json","paper":"/paper/2506.04185"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2020.acl-main.499","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T05:30:23.456663Z","title":null,"venue":null,"work_id":"03992c65-547e-4d18-94f3-20d6afa8a0b7","year":2020},"citing_paper":{"arxiv_id":"2506.04185","last_updated":"2025-06-04T17:29:22Z","snapshot_observed_at":"2026-08-09T13:15:04.057332Z","submitted_at":"2025-06-04T17:29:22Z","title":"R-Search: Empowering LLM Reasoning with Search via Multi-Reward Reinforcement Learning","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-07T10:54:30.274335Z"},"links":{"citing_paper":"/paper/2506.04185"},"observation_digest":"sha256:f712560648ccb172c786e0f949a4f0b23c5fc4891eb3810583602c0563710727","observation_id":"fbdc3536-4226-4620-aa14-1d80f49ea013","resolution":{"observed_at":"2026-08-07T10:54:31.014255Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:54:30.280264Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.04185","last_updated":"2025-06-04T17:29:22Z","snapshot_observed_at":"2026-08-09T13:15:04.057332Z","submitted_at":"2025-06-04T17:29:22Z","title":"R-Search: Empowering LLM Reasoning with Search via Multi-Reward Reinforcement Learning","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-07T10:54:30.280264Z"},"links":{"citing_paper":"/paper/2506.04185"},"observation_digest":"sha256:471d7fa8bda34a49990c4049165c5136df500369f1fba61a44a2625ded3a3937","observation_id":"c155b641-b8d7-4924-8234-4a2ea31e74bf","resolution":{"observed_at":"2026-08-07T10:54:30.280264Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:54:31.433342Z","title":null,"venue":null,"work_id":"f7e2157c-1259-47f6-833a-fb2298a94a47","year":2020},"citing_paper":{"arxiv_id":"2506.04185","last_updated":"2025-06-04T17:29:22Z","snapshot_observed_at":"2026-08-09T13:15:04.057332Z","submitted_at":"2025-06-04T17:29:22Z","title":"R-Search: Empowering LLM Reasoning with Search via Multi-Reward Reinforcement Learning","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-07T10:54:30.285547Z"},"links":{"citing_paper":"/paper/2506.04185"},"observation_digest":"sha256:6275ebd13ef362e73a27b821f745a5671a97b82ca26524fcc6d50efcf5e02e49","observation_id":"728e8402-de64-4bb0-9f16-18a2cbdb3567","resolution":{"observed_at":"2026-08-07T10:54:31.438391Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.00610","last_updated":"2024-03-31T08:58:54Z","snapshot_observed_at":"2026-08-09T13:15:07.647793Z","submitted_at":"2024-03-31T08:58:54Z","title":"RQ-RAG: Learning to Refine Queries for Retrieval Augmented Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.00610","snapshot_observed_at":"2026-08-07T10:54:30.291283Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.04185","last_updated":"2025-06-04T17:29:22Z","snapshot_observed_at":"2026-08-09T13:15:04.057332Z","submitted_at":"2025-06-04T17:29:22Z","title":"R-Search: Empowering LLM Reasoning with Search via Multi-Reward Reinforcement Learning","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-07T10:54:30.291283Z"},"links":{"cited_paper":"/paper/2404.00610","citing_paper":"/paper/2506.04185"},"observation_digest":"sha256:418a696b7fea8a3666c62be2211cdb1bddcbb81ceb7b1ce5df52ac1f888b4952","observation_id":"f14615f3-bf2f-4d9f-a4a3-038dbcb03f25","resolution":{"observed_at":"2026-08-07T10:54:30.291283Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:54:31.417296Z","title":null,"venue":null,"work_id":"0076eaf5-ad9b-4b0b-b280-a1500d7bf26b","year":2024},"citing_paper":{"arxiv_id":"2506.04185","last_updated":"2025-06-04T17:29:22Z","snapshot_observed_at":"2026-08-09T13:15:04.057332Z","submitted_at":"2025-06-04T17:29:22Z","title":"R-Search: Empowering LLM Reasoning with Search via Multi-Reward Reinforcement Learning","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-07T10:54:30.296904Z"},"links":{"citing_paper":"/paper/2506.04185"},"observation_digest":"sha256:b48233364789609db606a9f1a98d3871e52ed7fc67c3fce74abaa554584a83db","observation_id":"0458c6c1-fb1a-4acc-99d6-97775c449014","resolution":{"observed_at":"2026-08-07T10:54:31.422082Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:54:31.399571Z","title":null,"venue":null,"work_id":"365ee559-c62a-42d1-bfae-81ce2c9a7dbc","year":2023},"citing_paper":{"arxiv_id":"2506.04185","last_updated":"2025-06-04T17:29:22Z","snapshot_observed_at":"2026-08-09T13:15:04.057332Z","submitted_at":"2025-06-04T17:29:22Z","title":"R-Search: Empowering LLM Reasoning with Search via Multi-Reward Reinforcement Learning","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-07T10:54:30.302594Z"},"links":{"citing_paper":"/paper/2506.04185"},"observation_digest":"sha256:7b7bc056deab8fd02906fdbb2612898a9d356400891bd4df3a86595a2e80b44b","observation_id":"ea1ee574-c118-4222-b4dd-7a7a6fd9f773","resolution":{"observed_at":"2026-08-07T10:54:31.405352Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-07T10:54:30.308393Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.04185","last_updated":"2025-06-04T17:29:22Z","snapshot_observed_at":"2026-08-09T13:15:04.057332Z","submitted_at":"2025-06-04T17:29:22Z","title":"R-Search: Empowering LLM Reasoning with Search via Multi-Reward Reinforcement Learning","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-07T10:54:30.308393Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2506.04185"},"observation_digest":"sha256:995030b1f64919030512389c3f19fc277e9ec0b65f92ca5c59933d7245c343eb","observation_id":"b5b447c7-48d1-455a-bb56-c6389374d78c","resolution":{"observed_at":"2026-08-07T10:54:30.308393Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.10997","last_updated":"2024-03-27T09:16:57Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-18T07:47:33Z","title":"Retrieval-Augmented Generation for Large Language Models: A Survey","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.10997","snapshot_observed_at":"2026-08-07T10:54:30.313372Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.04185","last_updated":"2025-06-04T17:29:22Z","snapshot_observed_at":"2026-08-09T13:15:04.057332Z","submitted_at":"2025-06-04T17:29:22Z","title":"R-Search: Empowering LLM Reasoning with Search via Multi-Reward Reinforcement Learning","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-07T10:54:30.313372Z"},"links":{"cited_paper":"/paper/2312.10997","citing_paper":"/paper/2506.04185"},"observation_digest":"sha256:75227c2405d14b35583c79d2e691838df9d4ca34520bfaea6b5080c1a1be6181","observation_id":"e4d27694-6d90-4eab-b4c9-3dfd99f42d05","resolution":{"observed_at":"2026-08-07T10:54:30.313372Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.01142","last_updated":"2025-06-08T17:17:01Z","snapshot_observed_at":"2026-08-09T23:46:19.631522Z","submitted_at":"2025-02-03T08:22:45Z","title":"DeepRAG: Thinking to Retrieve Step by Step for Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.01142","snapshot_observed_at":"2026-08-07T10:54:30.319046Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.04185","last_updated":"2025-06-04T17:29:22Z","snapshot_observed_at":"2026-08-09T13:15:04.057332Z","submitted_at":"2025-06-04T17:29:22Z","title":"R-Search: Empowering LLM Reasoning with Search via Multi-Reward Reinforcement Learning","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-07T10:54:30.319046Z"},"links":{"cited_paper":"/paper/2502.01142","citing_paper":"/paper/2506.04185"},"observation_digest":"sha256:61bf556da00030a496832d1f8add3e247adb1717622d7c7cd07d5a218018f95c","observation_id":"aefe27e4-2382-442a-85b2-ee35c1f8f2b1","resolution":{"observed_at":"2026-08-07T10:54:30.319046Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-07T10:54:30.324627Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.04185","last_updated":"2025-06-04T17:29:22Z","snapshot_observed_at":"2026-08-09T13:15:04.057332Z","submitted_at":"2025-06-04T17:29:22Z","title":"R-Search: Empowering LLM Reasoning with Search via Multi-Reward Reinforcement Learning","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-07T10:54:30.324627Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2506.04185"},"observation_digest":"sha256:ba2aaf3a714a818646a7bcb645c0ccdd420afbfe2651068b1bb3b67d563c9a04","observation_id":"3dae0aa0-caff-4bfd-a084-1803c332fe30","resolution":{"observed_at":"2026-08-07T10:54:30.324627Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2002.08909","last_updated":"2020-02-10T18:40:59Z","snapshot_observed_at":"2026-08-02T17:52:27.326803Z","submitted_at":"2020-02-10T18:40:59Z","title":"REALM: Retrieval-Augmented Language Model Pre-Training","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2002.08909","snapshot_observed_at":"2026-08-07T10:54:30.330000Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.04185","last_updated":"2025-06-04T17:29:22Z","snapshot_observed_at":"2026-08-09T13:15:04.057332Z","submitted_at":"2025-06-04T17:29:22Z","title":"R-Search: Empowering LLM Reasoning with Search via Multi-Reward Reinforcement Learning","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-07T10:54:30.330000Z"},"links":{"cited_paper":"/paper/2002.08909","citing_paper":"/paper/2506.04185"},"observation_digest":"sha256:3d949c0011d2105a7a383911418ad8eba9ba793e5f7bc8a6b082112d0f7d4888","observation_id":"a2117c3f-9435-42da-923f-427d56c31482","resolution":{"observed_at":"2026-08-07T10:54:30.330000Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:54:30.338794Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.04185","last_updated":"2025-06-04T17:29:22Z","snapshot_observed_at":"2026-08-09T13:15:04.057332Z","submitted_at":"2025-06-04T17:29:22Z","title":"R-Search: Empowering LLM Reasoning with Search via Multi-Reward Reinforcement Learning","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-07T10:54:30.338794Z"},"links":{"citing_paper":"/paper/2506.04185"},"observation_digest":"sha256:076ab354846fb7de375b1e0ff7a2840a1659dab1c9ffaebd830a1afb9cd99dc0","observation_id":"f8cb34d6-2812-41e1-bfc2-cf3f690c9db6","resolution":{"observed_at":"2026-08-07T10:54:30.338794Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16720","last_updated":"2026-04-30T02:46:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-21T18:04:31Z","title":"OpenAI o1 System Card","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.16720","snapshot_observed_at":"2026-08-07T10:54:30.344581Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.04185","last_updated":"2025-06-04T17:29:22Z","snapshot_observed_at":"2026-08-09T13:15:04.057332Z","submitted_at":"2025-06-04T17:29:22Z","title":"R-Search: Empowering LLM Reasoning with Search via Multi-Reward Reinforcement Learning","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-07T10:54:30.344581Z"},"links":{"cited_paper":"/paper/2412.16720","citing_paper":"/paper/2506.04185"},"observation_digest":"sha256:f9e7620a5a57181a36a10a58253e194af9a7674824e1bc17ae8ffa9fcb0d1065","observation_id":"7f6099d7-897f-4297-ab19-3e0e65e07534","resolution":{"observed_at":"2026-08-07T10:54:30.344581Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:54:30.350126Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.04185","last_updated":"2025-06-04T17:29:22Z","snapshot_observed_at":"2026-08-09T13:15:04.057332Z","submitted_at":"2025-06-04T17:29:22Z","title":"R-Search: Empowering LLM Reasoning with Search via Multi-Reward Reinforcement Learning","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-07T10:54:30.350126Z"},"links":{"citing_paper":"/paper/2506.04185"},"observation_digest":"sha256:e7d424561b9c6ab9341bcd256e72b82156b8dc28d158e66df4467dcb1318fb51","observation_id":"408e75e1-1756-4072-9b89-bcf8d9d25e38","resolution":{"observed_at":"2026-08-07T10:54:30.350126Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:54:30.355185Z","title":"Xu, Luyu Gao, Zhiqing Sun, Qian Liu, Jane Dwivedi - Yu, Yiming Yang, Jamie Callan, and Graham Neubig","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.04185","last_updated":"2025-06-04T17:29:22Z","snapshot_observed_at":"2026-08-09T13:15:04.057332Z","submitted_at":"2025-06-04T17:29:22Z","title":"R-Search: Empowering LLM Reasoning with Search via Multi-Reward Reinforcement Learning","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-07T10:54:30.355185Z"},"links":{"citing_paper":"/paper/2506.04185"},"observation_digest":"sha256:077f46ae7f048da8b03463c47eecfcea1270a74bcf0e7a8aac0af63509f60be5","observation_id":"52555175-f859-48d1-9c71-24b6822bb064","resolution":{"observed_at":"2026-08-07T10:54:30.355185Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.09516","last_updated":"2025-08-05T19:08:38Z","snapshot_observed_at":"2026-07-06T20:51:28.022519Z","submitted_at":"2025-03-12T16:26:39Z","title":"Search-R1: Training LLMs to Reason and Leverage Search Engines with Reinforcement Learning","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.09516","snapshot_observed_at":"2026-08-07T10:54:30.360587Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.04185","last_updated":"2025-06-04T17:29:22Z","snapshot_observed_at":"2026-08-09T13:15:04.057332Z","submitted_at":"2025-06-04T17:29:22Z","title":"R-Search: Empowering LLM Reasoning with Search via Multi-Reward Reinforcement Learning","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-07T10:54:30.360587Z"},"links":{"cited_paper":"/paper/2503.09516","citing_paper":"/paper/2506.04185"},"observation_digest":"sha256:8f6805e1a70402d481da3d78836fa3c280f6e6106ec5763d356a9637ca4f44c6","observation_id":"c274fb56-4c2b-4edd-af2c-0b8fb4f8b6e6","resolution":{"observed_at":"2026-08-07T10:54:30.360587Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.13576","last_updated":"2025-02-24T02:46:52Z","snapshot_observed_at":"2026-08-10T07:11:50.780847Z","submitted_at":"2024-05-22T12:12:40Z","title":"FlashRAG: A Modular Toolkit for Efficient Retrieval-Augmented Generation Research","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.13576","snapshot_observed_at":"2026-08-07T10:54:30.366802Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.04185","last_updated":"2025-06-04T17:29:22Z","snapshot_observed_at":"2026-08-09T13:15:04.057332Z","submitted_at":"2025-06-04T17:29:22Z","title":"R-Search: Empowering LLM Reasoning with Search via Multi-Reward Reinforcement Learning","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-07T10:54:30.366802Z"},"links":{"cited_paper":"/paper/2405.13576","citing_paper":"/paper/2506.04185"},"observation_digest":"sha256:d40cff7ff51ce28ada62c394f794465b1b9fccdd2853ac35ed5aad2cf786e1c8","observation_id":"9c9dacb0-3a3c-45a9-854f-ae11ede5480e","resolution":{"observed_at":"2026-08-07T10:54:30.366802Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:54:30.372406Z","title":"Weld, and Luke Zettlemoyer","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.04185","last_updated":"2025-06-04T17:29:22Z","snapshot_observed_at":"2026-08-09T13:15:04.057332Z","submitted_at":"2025-06-04T17:29:22Z","title":"R-Search: Empowering LLM Reasoning with Search via Multi-Reward Reinforcement Learning","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-07T10:54:30.372406Z"},"links":{"citing_paper":"/paper/2506.04185"},"observation_digest":"sha256:8c55af02b1562f3e65991fec5499a04dbdf441f20edf27bcc4b1cc306dcb820d","observation_id":"627dcc3a-6959-49c1-b1bf-f05d5267f601","resolution":{"observed_at":"2026-08-07T10:54:30.372406Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:54:30.377138Z","title":null,"venue":null,"work_id":null,"year":1996},"citing_paper":{"arxiv_id":"2506.04185","last_updated":"2025-06-04T17:29:22Z","snapshot_observed_at":"2026-08-09T13:15:04.057332Z","submitted_at":"2025-06-04T17:29:22Z","title":"R-Search: Empowering LLM Reasoning with Search via Multi-Reward Reinforcement Learning","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-07T10:54:30.377138Z"},"links":{"citing_paper":"/paper/2506.04185"},"observation_digest":"sha256:4939a703d8560bcbe04c9a99a8db6274b8cc9fa704ccfdb71d293f86adafb092","observation_id":"20bd6a40-5b96-4d90-a4ef-8a52550e4607","resolution":{"observed_at":"2026-08-07T10:54:30.377138Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:54:30.382234Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.04185","last_updated":"2025-06-04T17:29:22Z","snapshot_observed_at":"2026-08-09T13:15:04.057332Z","submitted_at":"2025-06-04T17:29:22Z","title":"R-Search: Empowering LLM Reasoning with Search via Multi-Reward Reinforcement Learning","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-07T10:54:30.382234Z"},"links":{"citing_paper":"/paper/2506.04185"},"observation_digest":"sha256:ec8c5f51331b5ae1a89bc6c9f0f6c6fb8362a0bc17e77018086bf99db941eea7","observation_id":"2c522333-8a80-4eb4-8078-4b876b79c84a","resolution":{"observed_at":"2026-08-07T10:54:30.382234Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12917","last_updated":"2024-10-04T17:28:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-19T17:16:21Z","title":"Training Language Models to Self-Correct via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12917","snapshot_observed_at":"2026-08-07T10:54:30.386949Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.04185","last_updated":"2025-06-04T17:29:22Z","snapshot_observed_at":"2026-08-09T13:15:04.057332Z","submitted_at":"2025-06-04T17:29:22Z","title":"R-Search: Empowering LLM Reasoning with Search via Multi-Reward Reinforcement Learning","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-07T10:54:30.386949Z"},"links":{"cited_paper":"/paper/2409.12917","citing_paper":"/paper/2506.04185"},"observation_digest":"sha256:d4eaed4138cc2565d6f2e7e044c05169722bd338197b6f90bed93c67ab0a26ee","observation_id":"17d2ab95-057d-402f-9bee-7ed50560ea97","resolution":{"observed_at":"2026-08-07T10:54:30.386949Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:54:30.396880Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.04185","last_updated":"2025-06-04T17:29:22Z","snapshot_observed_at":"2026-08-09T13:15:04.057332Z","submitted_at":"2025-06-04T17:29:22Z","title":"R-Search: Empowering LLM Reasoning with Search via Multi-Reward Reinforcement Learning","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-07T10:54:30.396880Z"},"links":{"citing_paper":"/paper/2506.04185"},"observation_digest":"sha256:331cbcd5cbe571e1a5de5feced192ebc6add06a9dbc97969e8843874b4f8d1a1","observation_id":"ca83f98c-38fb-4070-ab48-be9fd457c959","resolution":{"observed_at":"2026-08-07T10:54:30.396880Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:54:30.402416Z","title":"u ttler, Mike Lewis, Wen - tau Yih, Tim Rockt \\","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.04185","last_updated":"2025-06-04T17:29:22Z","snapshot_observed_at":"2026-08-09T13:15:04.057332Z","submitted_at":"2025-06-04T17:29:22Z","title":"R-Search: Empowering LLM Reasoning with Search via Multi-Reward Reinforcement Learning","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-07T10:54:30.402416Z"},"links":{"citing_paper":"/paper/2506.04185"},"observation_digest":"sha256:ec86c1f88b2a5e55e61cbec4ed1eecc8c3e175691394172d1e53bc69a56d7fee","observation_id":"3a196208-39d9-4970-9db7-a4b97e708d13","resolution":{"observed_at":"2026-08-07T10:54:30.402416Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:54:30.407013Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.04185","last_updated":"2025-06-04T17:29:22Z","snapshot_observed_at":"2026-08-09T13:15:04.057332Z","submitted_at":"2025-06-04T17:29:22Z","title":"R-Search: Empowering LLM Reasoning with Search via Multi-Reward Reinforcement Learning","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-07T10:54:30.407013Z"},"links":{"citing_paper":"/paper/2506.04185"},"observation_digest":"sha256:5cf14c908ffc0f1c72962feff9179b5752079bea768b004691d6a702d47cd3b3","observation_id":"46fda872-3ffb-4558-a455-605f44d7e1c4","resolution":{"observed_at":"2026-08-07T10:54:30.407013Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:54:31.346276Z","title":null,"venue":null,"work_id":"8302ec2e-c328-4c6c-8cdb-145b793f310c","year":2024},"citing_paper":{"arxiv_id":"2506.04185","last_updated":"2025-06-04T17:29:22Z","snapshot_observed_at":"2026-08-09T13:15:04.057332Z","submitted_at":"2025-06-04T17:29:22Z","title":"R-Search: Empowering LLM Reasoning with Search via Multi-Reward Reinforcement Learning","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-07T10:54:30.411984Z"},"links":{"citing_paper":"/paper/2506.04185"},"observation_digest":"sha256:ca11e9cdc19b995986b5ca923b385527bee1a24894e76a23c0cae6f01d597b52","observation_id":"c433b464-ea9f-4427-b624-05adb958da6f","resolution":{"observed_at":"2026-08-07T10:54:31.352675Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:54:31.328867Z","title":null,"venue":null,"work_id":"3d2d2ec1-75e2-40d5-a2be-118bedcae7f5","year":2024},"citing_paper":{"arxiv_id":"2506.04185","last_updated":"2025-06-04T17:29:22Z","snapshot_observed_at":"2026-08-09T13:15:04.057332Z","submitted_at":"2025-06-04T17:29:22Z","title":"R-Search: Empowering LLM Reasoning with Search via Multi-Reward Reinforcement Learning","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-07T10:54:30.417627Z"},"links":{"citing_paper":"/paper/2506.04185"},"observation_digest":"sha256:a2461418644108b01221c053ac2f896a99fd575f66fcfaca24978ccaa749ce6a","observation_id":"c24b190f-2bfa-4b03-aadd-3d8b7aed4419","resolution":{"observed_at":"2026-08-07T10:54:31.334046Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-07T10:54:30.426294Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.04185","last_updated":"2025-06-04T17:29:22Z","snapshot_observed_at":"2026-08-09T13:15:04.057332Z","submitted_at":"2025-06-04T17:29:22Z","title":"R-Search: Empowering LLM Reasoning with Search via Multi-Reward Reinforcement Learning","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-07T10:54:30.426294Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2506.04185"},"observation_digest":"sha256:41e60aec7dadb607dc4729fb6a3b76d5872d272772b2940e7c4c1622f86971ff","observation_id":"f8bb9a67-7d7d-4f46-b83f-0bd423b7d5cf","resolution":{"observed_at":"2026-08-07T10:54:30.426294Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.48550/arxiv.2407.11511","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T05:30:23.456663Z","title":null,"venue":"arXiv (Cornell University)","work_id":"c2b67fd3-1918-4232-b9f7-7ed9bfe52e5f","year":2024},"citing_paper":{"arxiv_id":"2506.04185","last_updated":"2025-06-04T17:29:22Z","snapshot_observed_at":"2026-08-09T13:15:04.057332Z","submitted_at":"2025-06-04T17:29:22Z","title":"R-Search: Empowering LLM Reasoning with Search via Multi-Reward Reinforcement Learning","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-07T10:54:30.433102Z"},"links":{"citing_paper":"/paper/2506.04185"},"observation_digest":"sha256:f3180a9e22aaabe15ee817359869da1891562e0d6442a12a0014db2e7743e1a3","observation_id":"6d686e0a-dd7c-4f91-acc8-61c7629fb771","resolution":{"observed_at":"2026-08-07T10:54:30.814271Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:54:30.438229Z","title":"Smith, and Mike Lewis","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.04185","last_updated":"2025-06-04T17:29:22Z","snapshot_observed_at":"2026-08-09T13:15:04.057332Z","submitted_at":"2025-06-04T17:29:22Z","title":"R-Search: Empowering LLM Reasoning with Search via Multi-Reward Reinforcement Learning","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-07T10:54:30.438229Z"},"links":{"citing_paper":"/paper/2506.04185"},"observation_digest":"sha256:1f0d525a6970afe0a98e20193e41294a0d0a9edba6e7596999ed7a2e0386f20a","observation_id":"dc63a20b-8944-4eb4-bc6d-1ece1d2221cb","resolution":{"observed_at":"2026-08-07T10:54:30.438229Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:54:31.311989Z","title":"Hamilton, Chris Dyer, and Dani Yogatama","venue":null,"work_id":"4a624032-a483-42c4-9da7-2b3cc05f0086","year":2021},"citing_paper":{"arxiv_id":"2506.04185","last_updated":"2025-06-04T17:29:22Z","snapshot_observed_at":"2026-08-09T13:15:04.057332Z","submitted_at":"2025-06-04T17:29:22Z","title":"R-Search: Empowering LLM Reasoning with Search via Multi-Reward Reinforcement Learning","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-07T10:54:30.452391Z"},"links":{"citing_paper":"/paper/2506.04185"},"observation_digest":"sha256:43de1c452ecdbb0b115bf17dc7b51a309ebed84dfc2b17ceee78fad5dc30e9c3","observation_id":"fcf82ccf-3bca-47ba-9c8a-d3e1b1016088","resolution":{"observed_at":"2026-08-07T10:54:31.317364Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-07T10:54:30.459827Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.04185","last_updated":"2025-06-04T17:29:22Z","snapshot_observed_at":"2026-08-09T13:15:04.057332Z","submitted_at":"2025-06-04T17:29:22Z","title":"R-Search: Empowering LLM Reasoning with Search via Multi-Reward Reinforcement Learning","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-07T10:54:30.459827Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2506.04185"},"observation_digest":"sha256:939472da475087c178f95bc2eeddb0784179a94bfd098c0a006150f3452064aa","observation_id":"bae75213-a5d1-42b0-86b0-f506496e4722","resolution":{"observed_at":"2026-08-07T10:54:30.459827Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:54:30.469858Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.04185","last_updated":"2025-06-04T17:29:22Z","snapshot_observed_at":"2026-08-09T13:15:04.057332Z","submitted_at":"2025-06-04T17:29:22Z","title":"R-Search: Empowering LLM Reasoning with Search via Multi-Reward Reinforcement Learning","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-07T10:54:30.469858Z"},"links":{"citing_paper":"/paper/2506.04185"},"observation_digest":"sha256:cfb05ac21679c097b68cb8660fad4bcb72f8ff20edeaeff5a43fc50e7e8b64c7","observation_id":"c30857ee-2823-4424-89db-3c9bbfc19591","resolution":{"observed_at":"2026-08-07T10:54:30.469858Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-07T10:54:30.477067Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.04185","last_updated":"2025-06-04T17:29:22Z","snapshot_observed_at":"2026-08-09T13:15:04.057332Z","submitted_at":"2025-06-04T17:29:22Z","title":"R-Search: Empowering LLM Reasoning with Search via Multi-Reward Reinforcement Learning","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-07T10:54:30.477067Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2506.04185"},"observation_digest":"sha256:548298518830a310ce6e821befd8187091c7a2f13c5e296c623517684f1828fd","observation_id":"d8032718-9c9e-405e-a0c7-87b19773f16c","resolution":{"observed_at":"2026-08-07T10:54:30.477067Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:54:30.490021Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.04185","last_updated":"2025-06-04T17:29:22Z","snapshot_observed_at":"2026-08-09T13:15:04.057332Z","submitted_at":"2025-06-04T17:29:22Z","title":"R-Search: Empowering LLM Reasoning with Search via Multi-Reward Reinforcement Learning","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-07T10:54:30.490021Z"},"links":{"citing_paper":"/paper/2506.04185"},"observation_digest":"sha256:9f994bd24dba31ebbd95f554dfb7552f69f301aa37e2a62f86ce4a21c1673033","observation_id":"18bd1d35-7962-433c-85db-c9a5f62d1ff6","resolution":{"observed_at":"2026-08-07T10:54:30.490021Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:54:30.496064Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.04185","last_updated":"2025-06-04T17:29:22Z","snapshot_observed_at":"2026-08-09T13:15:04.057332Z","submitted_at":"2025-06-04T17:29:22Z","title":"R-Search: Empowering LLM Reasoning with Search via Multi-Reward Reinforcement Learning","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-07T10:54:30.496064Z"},"links":{"citing_paper":"/paper/2506.04185"},"observation_digest":"sha256:79ceaf60edeb4dc06f13a62f25185a33771760f2e12cfb52774ede15ba76508b","observation_id":"bd59f18c-0d90-4f7e-a453-cdf0ff7fbca9","resolution":{"observed_at":"2026-08-07T10:54:30.496064Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:54:30.500940Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.04185","last_updated":"2025-06-04T17:29:22Z","snapshot_observed_at":"2026-08-09T13:15:04.057332Z","submitted_at":"2025-06-04T17:29:22Z","title":"R-Search: Empowering LLM Reasoning with Search via Multi-Reward Reinforcement Learning","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-07T10:54:30.500940Z"},"links":{"citing_paper":"/paper/2506.04185"},"observation_digest":"sha256:a83e61b8434cea37648060af36f0fedb9b747e6ce210155d53a4573d88e427e0","observation_id":"af55d101-5b80-4f5e-ac71-85e70df80ed6","resolution":{"observed_at":"2026-08-07T10:54:30.500940Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.09561","last_updated":"2023-10-19T12:24:42Z","snapshot_observed_at":"2026-08-08T23:00:32.885841Z","submitted_at":"2022-12-19T15:51:52Z","title":"Large Language Models are Better Reasoners with Self-Verification","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.09561","snapshot_observed_at":"2026-08-07T10:54:30.506047Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.04185","last_updated":"2025-06-04T17:29:22Z","snapshot_observed_at":"2026-08-09T13:15:04.057332Z","submitted_at":"2025-06-04T17:29:22Z","title":"R-Search: Empowering LLM Reasoning with Search via Multi-Reward Reinforcement Learning","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-07T10:54:30.506047Z"},"links":{"cited_paper":"/paper/2212.09561","citing_paper":"/paper/2506.04185"},"observation_digest":"sha256:85c118efd15c2daece96adf3311b90791887b38a48abf7b2acec025b942b9fb9","observation_id":"c931d564-86c3-4854-8096-736595ec00c7","resolution":{"observed_at":"2026-08-07T10:54:30.506047Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:54:31.293582Z","title":null,"venue":null,"work_id":"08ec3ea6-084d-4352-89e7-bc5de9ed7d52","year":2012},"citing_paper":{"arxiv_id":"2506.04185","last_updated":"2025-06-04T17:29:22Z","snapshot_observed_at":"2026-08-09T13:15:04.057332Z","submitted_at":"2025-06-04T17:29:22Z","title":"R-Search: Empowering LLM Reasoning with Search via Multi-Reward Reinforcement Learning","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-07T10:54:30.510945Z"},"links":{"citing_paper":"/paper/2506.04185"},"observation_digest":"sha256:4264e2ab4021b2b2a24424028db735ae3804c24b5a5bc8643eaa8ea7f3fb97c3","observation_id":"5a9be03b-020e-41a3-9b34-421110aa12fb","resolution":{"observed_at":"2026-08-07T10:54:31.299174Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15115","snapshot_observed_at":"2026-08-07T10:54:30.515642Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.04185","last_updated":"2025-06-04T17:29:22Z","snapshot_observed_at":"2026-08-09T13:15:04.057332Z","submitted_at":"2025-06-04T17:29:22Z","title":"R-Search: Empowering LLM Reasoning with Search via Multi-Reward Reinforcement Learning","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-07T10:54:30.515642Z"},"links":{"cited_paper":"/paper/2412.15115","citing_paper":"/paper/2506.04185"},"observation_digest":"sha256:33c129a250387690b7dd302132a8fba5b7699e11ff056e49aff5ae963d6c8440","observation_id":"82a47b6f-2838-4763-95c5-5382dddf54a7","resolution":{"observed_at":"2026-08-07T10:54:30.515642Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:54:30.520686Z","title":"Cohen, Ruslan Salakhutdinov, and Christopher D","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.04185","last_updated":"2025-06-04T17:29:22Z","snapshot_observed_at":"2026-08-09T13:15:04.057332Z","submitted_at":"2025-06-04T17:29:22Z","title":"R-Search: Empowering LLM Reasoning with Search via Multi-Reward Reinforcement Learning","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-07T10:54:30.520686Z"},"links":{"citing_paper":"/paper/2506.04185"},"observation_digest":"sha256:326e3bb93daf24073bad345f5d96d6de54f40f3fef7585498ffa8a2cea12ef7c","observation_id":"a9a73950-9e81-4df9-97c0-d657ab55938b","resolution":{"observed_at":"2026-08-07T10:54:30.520686Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:54:31.276282Z","title":null,"venue":null,"work_id":"4e6a8c76-ae17-4889-8a82-380ced51bb63","year":2024},"citing_paper":{"arxiv_id":"2506.04185","last_updated":"2025-06-04T17:29:22Z","snapshot_observed_at":"2026-08-09T13:15:04.057332Z","submitted_at":"2025-06-04T17:29:22Z","title":"R-Search: Empowering LLM Reasoning with Search via Multi-Reward Reinforcement Learning","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-07T10:54:30.525537Z"},"links":{"citing_paper":"/paper/2506.04185"},"observation_digest":"sha256:6469357cae65d4440eb0cc7a43517dc683ba58ec395cbb375c35c73294c06a64","observation_id":"274306c3-fb9d-4eaf-9901-3a7d595e016f","resolution":{"observed_at":"2026-08-07T10:54:31.281471Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.12793","last_updated":"2024-07-30T03:58:11Z","snapshot_observed_at":"2026-08-07T13:56:34.167869Z","submitted_at":"2024-06-18T16:58:21Z","title":"ChatGLM: A Family of Large Language Models from GLM-130B to GLM-4 All Tools","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.12793","snapshot_observed_at":"2026-08-07T10:54:30.531319Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.04185","last_updated":"2025-06-04T17:29:22Z","snapshot_observed_at":"2026-08-09T13:15:04.057332Z","submitted_at":"2025-06-04T17:29:22Z","title":"R-Search: Empowering LLM Reasoning with Search via Multi-Reward Reinforcement Learning","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-07T10:54:30.531319Z"},"links":{"cited_paper":"/paper/2406.12793","citing_paper":"/paper/2506.04185"},"observation_digest":"sha256:dbc930624c19fc60947afaadeead1c6312c0de47832039910ea56498a66af5ea","observation_id":"2f4f4220-882a-42d8-b558-e67ea766ce81","resolution":{"observed_at":"2026-08-07T10:54:30.531319Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.01219","last_updated":"2025-09-14T09:34:46Z","snapshot_observed_at":"2026-07-06T16:13:46.112815Z","submitted_at":"2023-09-03T16:56:48Z","title":"Siren's Song in the AI Ocean: A Survey on Hallucination in Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.01219","snapshot_observed_at":"2026-08-07T10:54:30.536308Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.04185","last_updated":"2025-06-04T17:29:22Z","snapshot_observed_at":"2026-08-09T13:15:04.057332Z","submitted_at":"2025-06-04T17:29:22Z","title":"R-Search: Empowering LLM Reasoning with Search via Multi-Reward Reinforcement Learning","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-07T10:54:30.536308Z"},"links":{"cited_paper":"/paper/2309.01219","citing_paper":"/paper/2506.04185"},"observation_digest":"sha256:ce2f1b5fd2ee2d6586d42826fbb4415b887e28deb9b109b5202c65c99feeb8a1","observation_id":"eb7b1617-4827-4063-a3b5-eef1198cf550","resolution":{"observed_at":"2026-08-07T10:54:30.536308Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:54:31.258457Z","title":null,"venue":null,"work_id":"f89a7d31-cb0d-4d02-ac4d-aa840631ac88","year":2024},"citing_paper":{"arxiv_id":"2506.04185","last_updated":"2025-06-04T17:29:22Z","snapshot_observed_at":"2026-08-09T13:15:04.057332Z","submitted_at":"2025-06-04T17:29:22Z","title":"R-Search: Empowering LLM Reasoning with Search via Multi-Reward Reinforcement Learning","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-07T10:54:30.541560Z"},"links":{"citing_paper":"/paper/2506.04185"},"observation_digest":"sha256:6e128bea6fe058a98b632434b6d999fbcb2ad617eebe5df013f446f3c4b0a162","observation_id":"49404bab-a40d-4d0f-8bac-a4fa4024a915","resolution":{"observed_at":"2026-08-07T10:54:31.263577Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.04185","last_updated":"2025-06-04T17:29:22Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-09T13:15:04.057332Z","submitted_at":"2025-06-04T17:29:22Z","title":"R-Search: Empowering LLM Reasoning with Search via Multi-Reward Reinforcement Learning"},"reference_resolution":{"displayed":44,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":40,"verified_exact":2,"verified_fuzzy":1},"total_outbound_references":44},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 44 of 44 outbound references and 14 inbound Pith citation observations for arXiv:2506.04185."}