{"as_of":"2026-08-18T14:28:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:efe7d3e2b5389950072332cc1063a9ae69428baa8d900cecc393885e5fd821dd","coverage":[{"denominator":43,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":43,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T23:15:50.932630Z","state":"measured"},{"denominator":43,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":43,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-18T06:34:40.430872+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2608.03223/citation-record","integrity":"/paper/2608.03223/integrity","json":"/paper/2608.03223/citation-record.json","paper":"/paper/2608.03223"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:15:51.856594Z","title":null,"venue":null,"work_id":"1b0197ee-714f-4ff2-b7cc-761b3ec08a7a","year":2024},"citing_paper":{"arxiv_id":"2608.03223","last_updated":"2026-08-04T06:56:47Z","snapshot_observed_at":"2026-08-17T21:53:51.596626Z","submitted_at":"2026-08-04T06:56:47Z","title":"Agentic Reinforcement Learning with Self-Distilled Reward Shaping","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-05T23:15:50.697103Z"},"links":{"citing_paper":"/paper/2608.03223"},"observation_digest":"sha256:b435ee5631727da8446d3c3a14eb39c0c5cd7da42c2a03db43cda49858eb0817","observation_id":"8675798f-b798-4d3f-8c9c-fdb46028c21f","resolution":{"observed_at":"2026-08-05T23:15:51.861115Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:15:51.842065Z","title":null,"venue":null,"work_id":"6d07b800-7250-448b-8125-c9a2930b6bfc","year":2019},"citing_paper":{"arxiv_id":"2608.03223","last_updated":"2026-08-04T06:56:47Z","snapshot_observed_at":"2026-08-17T21:53:51.596626Z","submitted_at":"2026-08-04T06:56:47Z","title":"Agentic Reinforcement Learning with Self-Distilled Reward Shaping","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-05T23:15:50.718401Z"},"links":{"citing_paper":"/paper/2608.03223"},"observation_digest":"sha256:133b493ee01f1da919998634c60365e2a91e53dd95a908015cc42e58fc85158a","observation_id":"ff4f27e9-3352-42d5-86aa-a439fd126d03","resolution":{"observed_at":"2026-08-05T23:15:51.846448Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.01600","last_updated":"2025-03-08T05:23:57Z","snapshot_observed_at":"2026-08-18T03:07:34.996948Z","submitted_at":"2025-02-03T18:35:42Z","title":"Reinforcement Learning for Long-Horizon Interactive LLM Agents","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.01600","snapshot_observed_at":"2026-08-05T23:15:50.724043Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.03223","last_updated":"2026-08-04T06:56:47Z","snapshot_observed_at":"2026-08-17T21:53:51.596626Z","submitted_at":"2026-08-04T06:56:47Z","title":"Agentic Reinforcement Learning with Self-Distilled Reward Shaping","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-05T23:15:50.724043Z"},"links":{"cited_paper":"/paper/2502.01600","citing_paper":"/paper/2608.03223"},"observation_digest":"sha256:35824710b50683a50c8ba926b8dac833f7479f4a78505a22286bfc835c65e744","observation_id":"9adefe45-cc4b-402a-a50d-2d780189b19a","resolution":{"observed_at":"2026-08-05T23:15:50.724043Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:15:50.729905Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.03223","last_updated":"2026-08-04T06:56:47Z","snapshot_observed_at":"2026-08-17T21:53:51.596626Z","submitted_at":"2026-08-04T06:56:47Z","title":"Agentic Reinforcement Learning with Self-Distilled Reward Shaping","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-05T23:15:50.729905Z"},"links":{"citing_paper":"/paper/2608.03223"},"observation_digest":"sha256:4b3b6cc04cb9b2fc2c6f712d224ef6dc82bb548847fe1440c5077ade85cfd549","observation_id":"92a3e15b-408b-41b7-aaf8-4ee8842f5ce9","resolution":{"observed_at":"2026-08-05T23:15:50.729905Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:15:51.825464Z","title":null,"venue":null,"work_id":"1682e057-a4c5-442c-b8d6-c6582aba2089","year":2026},"citing_paper":{"arxiv_id":"2608.03223","last_updated":"2026-08-04T06:56:47Z","snapshot_observed_at":"2026-08-17T21:53:51.596626Z","submitted_at":"2026-08-04T06:56:47Z","title":"Agentic Reinforcement Learning with Self-Distilled Reward Shaping","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-05T23:15:50.737402Z"},"links":{"citing_paper":"/paper/2608.03223"},"observation_digest":"sha256:aa1d5e90fd1697443e981f3d4d3065794a4ffd365e37ffc42e565d70f0a49a7a","observation_id":"13156ec5-b935-4634-b9ce-a745c9ddf324","resolution":{"observed_at":"2026-08-05T23:15:51.830528Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1503.02531","last_updated":"2015-03-09T15:44:49Z","snapshot_observed_at":"2026-08-16T18:00:58.008096Z","submitted_at":"2015-03-09T15:44:49Z","title":"Distilling the Knowledge in a Neural Network","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1503.02531","snapshot_observed_at":"2026-08-05T23:15:50.742839Z","title":null,"venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2608.03223","last_updated":"2026-08-04T06:56:47Z","snapshot_observed_at":"2026-08-17T21:53:51.596626Z","submitted_at":"2026-08-04T06:56:47Z","title":"Agentic Reinforcement Learning with Self-Distilled Reward Shaping","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-05T23:15:50.742839Z"},"links":{"cited_paper":"/paper/1503.02531","citing_paper":"/paper/2608.03223"},"observation_digest":"sha256:9d22ae1e8eeed0c156796876549f0e4b4217fb95aea7af15bf3dfb1213f1f7d3","observation_id":"b138fd6e-ac23-4e3d-87a5-68837a7b8bbb","resolution":{"observed_at":"2026-08-05T23:15:50.742839Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:15:50.749272Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2608.03223","last_updated":"2026-08-04T06:56:47Z","snapshot_observed_at":"2026-08-17T21:53:51.596626Z","submitted_at":"2026-08-04T06:56:47Z","title":"Agentic Reinforcement Learning with Self-Distilled Reward Shaping","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-05T23:15:50.749272Z"},"links":{"citing_paper":"/paper/2608.03223"},"observation_digest":"sha256:2317bdd60ab7bba60262bd2822bcb64f6bbe398bc65549cc5c11aee5bf143b13","observation_id":"71826fd6-80ac-44a6-9ed0-dd1d21f9e9ef","resolution":{"observed_at":"2026-08-05T23:15:50.749272Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2601.20802","last_updated":"2026-02-16T14:49:34Z","snapshot_observed_at":"2026-08-13T15:28:29.238641Z","submitted_at":"2026-01-28T17:45:12Z","title":"Reinforcement Learning via Self-Distillation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2601.20802","snapshot_observed_at":"2026-08-05T23:15:50.754062Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.03223","last_updated":"2026-08-04T06:56:47Z","snapshot_observed_at":"2026-08-17T21:53:51.596626Z","submitted_at":"2026-08-04T06:56:47Z","title":"Agentic Reinforcement Learning with Self-Distilled Reward Shaping","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-05T23:15:50.754062Z"},"links":{"cited_paper":"/paper/2601.20802","citing_paper":"/paper/2608.03223"},"observation_digest":"sha256:0f7957559625a648ce8c48071e1d3f4835b6d9a939185e9eeeaa71272c04e6cc","observation_id":"baa0c435-e836-4b37-91fd-d4d9b6e538de","resolution":{"observed_at":"2026-08-05T23:15:50.754062Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.09516","last_updated":"2025-08-05T19:08:38Z","snapshot_observed_at":"2026-08-15T13:17:00.526689Z","submitted_at":"2025-03-12T16:26:39Z","title":"Search-R1: Training LLMs to Reason and Leverage Search Engines with Reinforcement Learning","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.09516","snapshot_observed_at":"2026-08-05T23:15:50.758886Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.03223","last_updated":"2026-08-04T06:56:47Z","snapshot_observed_at":"2026-08-17T21:53:51.596626Z","submitted_at":"2026-08-04T06:56:47Z","title":"Agentic Reinforcement Learning with Self-Distilled Reward Shaping","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-05T23:15:50.758886Z"},"links":{"cited_paper":"/paper/2503.09516","citing_paper":"/paper/2608.03223"},"observation_digest":"sha256:546815408cea3696204ecb5e14585e9c833aa52360c0e461fadf40f547ce58e8","observation_id":"fab17f2f-af4e-492e-8d1e-40c658fa80bc","resolution":{"observed_at":"2026-08-05T23:15:50.758886Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:15:51.799787Z","title":"Triviaqa: A large scale distantly supervised challenge dataset for reading comprehension","venue":null,"work_id":"f3559152-75b5-420d-80d2-391e482f0db1","year":2017},"citing_paper":{"arxiv_id":"2608.03223","last_updated":"2026-08-04T06:56:47Z","snapshot_observed_at":"2026-08-17T21:53:51.596626Z","submitted_at":"2026-08-04T06:56:47Z","title":"Agentic Reinforcement Learning with Self-Distilled Reward Shaping","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-05T23:15:50.763497Z"},"links":{"citing_paper":"/paper/2608.03223"},"observation_digest":"sha256:0b7d254ead4cba0f29218ffe0a7381e8dcdab8913932e83d75fdb32fbe91fdd0","observation_id":"7ebed2cd-4208-4aa5-bc04-7de91ad3f08c","resolution":{"observed_at":"2026-08-05T23:15:51.804385Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2605.10781","last_updated":"2026-05-11T16:16:00Z","snapshot_observed_at":"2026-08-14T02:21:03.214054Z","submitted_at":"2026-05-11T16:16:00Z","title":"Rebellious Student: Reversing Teacher Signals for Reasoning Exploration with Self-Distilled RLVR","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.10781","snapshot_observed_at":"2026-08-05T23:15:50.767987Z","title":"RebelliousStu- dent: Reversing Teacher Signals for Reasoning Exploration with Self-Distilled RLVR","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.03223","last_updated":"2026-08-04T06:56:47Z","snapshot_observed_at":"2026-08-17T21:53:51.596626Z","submitted_at":"2026-08-04T06:56:47Z","title":"Agentic Reinforcement Learning with Self-Distilled Reward Shaping","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-05T23:15:50.767987Z"},"links":{"cited_paper":"/paper/2605.10781","citing_paper":"/paper/2608.03223"},"observation_digest":"sha256:2d2f910afbd60caeab98874e81e9f51d38a81558fa7f25a64f8244696f975046","observation_id":"d37c7dd3-f9be-4136-8c78-68c3880e9b1d","resolution":{"observed_at":"2026-08-05T23:15:50.767987Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:15:51.783555Z","title":"Naturalquestions:abenchmarkforquestionansweringresearch","venue":null,"work_id":"7ac71897-2d57-41f8-834a-1aa06d621675","year":2019},"citing_paper":{"arxiv_id":"2608.03223","last_updated":"2026-08-04T06:56:47Z","snapshot_observed_at":"2026-08-17T21:53:51.596626Z","submitted_at":"2026-08-04T06:56:47Z","title":"Agentic Reinforcement Learning with Self-Distilled Reward Shaping","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-05T23:15:50.773613Z"},"links":{"citing_paper":"/paper/2608.03223"},"observation_digest":"sha256:a2df77d31481ffe1d19a2088780efdd994d539db092700530f3976635fef060f","observation_id":"cb700ff0-c4a3-41e1-926a-7527f6a98784","resolution":{"observed_at":"2026-08-05T23:15:51.788550Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:15:51.767213Z","title":null,"venue":null,"work_id":"52b042b5-70fd-486c-8460-cda1f6cf9f94","year":2024},"citing_paper":{"arxiv_id":"2608.03223","last_updated":"2026-08-04T06:56:47Z","snapshot_observed_at":"2026-08-17T21:53:51.596626Z","submitted_at":"2026-08-04T06:56:47Z","title":"Agentic Reinforcement Learning with Self-Distilled Reward Shaping","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-05T23:15:50.778337Z"},"links":{"citing_paper":"/paper/2608.03223"},"observation_digest":"sha256:c9a6819a9c06190a9754e2fc69d9aa6ba7b33e9f5accbbe1c8ecacbe59e2ba8a","observation_id":"4bd96b65-717d-43ab-8852-d01b4c418612","resolution":{"observed_at":"2026-08-05T23:15:51.771787Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2606.04036","last_updated":"2026-06-02T02:31:13Z","snapshot_observed_at":"2026-08-05T09:50:41.075111Z","submitted_at":"2026-06-02T02:31:13Z","title":"Self-Distilled Policy Gradient","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2606.04036","snapshot_observed_at":"2026-08-05T23:15:50.786116Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.03223","last_updated":"2026-08-04T06:56:47Z","snapshot_observed_at":"2026-08-17T21:53:51.596626Z","submitted_at":"2026-08-04T06:56:47Z","title":"Agentic Reinforcement Learning with Self-Distilled Reward Shaping","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-05T23:15:50.786116Z"},"links":{"cited_paper":"/paper/2606.04036","citing_paper":"/paper/2608.03223"},"observation_digest":"sha256:f53845cb5228c2051df99794537bd2992cb131dbf3a398884fe59e6ba6cc63c1","observation_id":"e3be0fea-2032-4c84-8e10-cf1b97b8d851","resolution":{"observed_at":"2026-08-05T23:15:50.786116Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.15155","last_updated":"2026-05-14T17:51:26Z","snapshot_observed_at":"2026-08-16T20:35:48.643273Z","submitted_at":"2026-05-14T17:51:26Z","title":"Self-Distilled Agentic Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.15155","snapshot_observed_at":"2026-08-05T23:15:50.790996Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.03223","last_updated":"2026-08-04T06:56:47Z","snapshot_observed_at":"2026-08-17T21:53:51.596626Z","submitted_at":"2026-08-04T06:56:47Z","title":"Agentic Reinforcement Learning with Self-Distilled Reward Shaping","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-05T23:15:50.790996Z"},"links":{"cited_paper":"/paper/2605.15155","citing_paper":"/paper/2608.03223"},"observation_digest":"sha256:37ebbd09f1a27db2dc459f9f538cc2bce6fc245064e26f131dd4b16bd96ecfb3","observation_id":"508bf451-91ee-42c2-ab64-7fdc6610c639","resolution":{"observed_at":"2026-08-05T23:15:50.790996Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.03680","last_updated":"2025-08-05T17:50:13Z","snapshot_observed_at":"2026-08-15T03:48:34.730767Z","submitted_at":"2025-08-05T17:50:13Z","title":"Agent Lightning: Train ANY AI Agents with Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.03680","snapshot_observed_at":"2026-08-05T23:15:50.795278Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.03223","last_updated":"2026-08-04T06:56:47Z","snapshot_observed_at":"2026-08-17T21:53:51.596626Z","submitted_at":"2026-08-04T06:56:47Z","title":"Agentic Reinforcement Learning with Self-Distilled Reward Shaping","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-05T23:15:50.795278Z"},"links":{"cited_paper":"/paper/2508.03680","citing_paper":"/paper/2608.03223"},"observation_digest":"sha256:c9488d938b506991f3b8ab447b55565306b91fd43d5ddb0c6032c43341350092","observation_id":"525c4e31-9b8a-4ab2-8e01-d00e5e1783af","resolution":{"observed_at":"2026-08-05T23:15:50.795278Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:15:51.743526Z","title":null,"venue":null,"work_id":"3ca4990c-0d00-450b-b62e-22006e959e87","year":2023},"citing_paper":{"arxiv_id":"2608.03223","last_updated":"2026-08-04T06:56:47Z","snapshot_observed_at":"2026-08-17T21:53:51.596626Z","submitted_at":"2026-08-04T06:56:47Z","title":"Agentic Reinforcement Learning with Self-Distilled Reward Shaping","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-05T23:15:50.800345Z"},"links":{"citing_paper":"/paper/2608.03223"},"observation_digest":"sha256:7139a47d053009712ff88388bd48f3682545175b8e21f4f158cb6b76f3669f1e","observation_id":"5b79254f-3fc5-400c-8af9-09f6132a4b10","resolution":{"observed_at":"2026-08-05T23:15:51.750157Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2606.29476","last_updated":"2026-06-28T16:11:47Z","snapshot_observed_at":"2026-08-14T02:03:49.084110Z","submitted_at":"2026-06-28T16:11:47Z","title":"CRAFT: Counterfactual Credit Assignment from Free Sibling Rollouts for Self-Distilled Agentic Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2606.29476","doi":null,"metadata_source":"pith","pith_arxiv_id":"2606.29476","snapshot_observed_at":"2026-08-05T23:15:51.308108Z","title":"CRAFT: Counterfactual Credit Assignment from Free Sibling Rollouts for Self-Distilled Agentic Reinforcement Learning","venue":"cs.LG","work_id":"cfccfd73-246c-4411-8341-3f6f37cb0132","year":2026},"citing_paper":{"arxiv_id":"2608.03223","last_updated":"2026-08-04T06:56:47Z","snapshot_observed_at":"2026-08-17T21:53:51.596626Z","submitted_at":"2026-08-04T06:56:47Z","title":"Agentic Reinforcement Learning with Self-Distilled Reward Shaping","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-05T23:15:50.804723Z"},"links":{"cited_paper":"/paper/2606.29476","citing_paper":"/paper/2608.03223"},"observation_digest":"sha256:063d9f47a4cc803c11bd85330bc00e1a4085648a05658e30baf2be79de9d6f76","observation_id":"b605da9c-739d-4e15-9d83-ecdac7487221","resolution":{"observed_at":"2026-08-05T23:15:51.319505Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:15:51.725443Z","title":null,"venue":null,"work_id":"192ca86f-c7b0-4497-8ada-7b6600ca2002","year":1999},"citing_paper":{"arxiv_id":"2608.03223","last_updated":"2026-08-04T06:56:47Z","snapshot_observed_at":"2026-08-17T21:53:51.596626Z","submitted_at":"2026-08-04T06:56:47Z","title":"Agentic Reinforcement Learning with Self-Distilled Reward Shaping","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-05T23:15:50.809974Z"},"links":{"citing_paper":"/paper/2608.03223"},"observation_digest":"sha256:541617e18dfca31d7d551c9c4e85ef730a27b51df2d344861a5a3c04c6b4fa6d","observation_id":"1011db5f-b902-4973-b2a2-3ad1da50d45d","resolution":{"observed_at":"2026-08-05T23:15:51.730575Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:15:51.708138Z","title":null,"venue":null,"work_id":"edb7f263-30f2-419e-a9be-22e626aafbe3","year":2023},"citing_paper":{"arxiv_id":"2608.03223","last_updated":"2026-08-04T06:56:47Z","snapshot_observed_at":"2026-08-17T21:53:51.596626Z","submitted_at":"2026-08-04T06:56:47Z","title":"Agentic Reinforcement Learning with Self-Distilled Reward Shaping","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-05T23:15:50.814148Z"},"links":{"citing_paper":"/paper/2608.03223"},"observation_digest":"sha256:e9135bf1853c2b82327791b36541de9fa1ac6deece786efca234e2d11e2b6ff9","observation_id":"ecdbda85-cc2f-4523-a3cc-f02fe3097b57","resolution":{"observed_at":"2026-08-05T23:15:51.713178Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-08-17T18:50:07.059564Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15115","snapshot_observed_at":"2026-08-05T23:15:50.818627Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.03223","last_updated":"2026-08-04T06:56:47Z","snapshot_observed_at":"2026-08-17T21:53:51.596626Z","submitted_at":"2026-08-04T06:56:47Z","title":"Agentic Reinforcement Learning with Self-Distilled Reward Shaping","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-05T23:15:50.818627Z"},"links":{"cited_paper":"/paper/2412.15115","citing_paper":"/paper/2608.03223"},"observation_digest":"sha256:1bc1d02cedd6849a35487020a4edf294c0ebde4c9e2170c2405c3cc963a7a5ec","observation_id":"5dfa644a-6dee-4f8e-a030-92755311a9dc","resolution":{"observed_at":"2026-08-05T23:15:50.818627Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:15:51.689318Z","title":null,"venue":null,"work_id":"7cb6c4e1-6aa9-4649-9ffd-a74bd4aceea9","year":2011},"citing_paper":{"arxiv_id":"2608.03223","last_updated":"2026-08-04T06:56:47Z","snapshot_observed_at":"2026-08-17T21:53:51.596626Z","submitted_at":"2026-08-04T06:56:47Z","title":"Agentic Reinforcement Learning with Self-Distilled Reward Shaping","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-05T23:15:50.823637Z"},"links":{"citing_paper":"/paper/2608.03223"},"observation_digest":"sha256:d0fcd89496022d5627cc2cbc0c4f914491f3fb6eb7a869bc89832d1ef3abf2fc","observation_id":"fd82cd44-8337-4a08-8b01-2c0467438122","resolution":{"observed_at":"2026-08-05T23:15:51.693931Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:15:50.827697Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03223","last_updated":"2026-08-04T06:56:47Z","snapshot_observed_at":"2026-08-17T21:53:51.596626Z","submitted_at":"2026-08-04T06:56:47Z","title":"Agentic Reinforcement Learning with Self-Distilled Reward Shaping","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-05T23:15:50.827697Z"},"links":{"citing_paper":"/paper/2608.03223"},"observation_digest":"sha256:8bbbb72f7bfd6b5239e9efded8ce3db3211e8df74b8ae7a9d3ddd4c2fa49727b","observation_id":"035ec4cb-5dc6-43fc-bbd5-e08891a2cefe","resolution":{"observed_at":"2026-08-05T23:15:50.827697Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-05T23:15:50.837192Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.03223","last_updated":"2026-08-04T06:56:47Z","snapshot_observed_at":"2026-08-17T21:53:51.596626Z","submitted_at":"2026-08-04T06:56:47Z","title":"Agentic Reinforcement Learning with Self-Distilled Reward Shaping","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-05T23:15:50.837192Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2608.03223"},"observation_digest":"sha256:3c0c8b15d92c96b73b06cb7b2bf97ff92cbe43e960f3c33f152133e73bb55ab3","observation_id":"c6d0de95-b5ef-4323-9231-c65a20275e07","resolution":{"observed_at":"2026-08-05T23:15:50.837192Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.03768","last_updated":"2021-03-14T22:44:38Z","snapshot_observed_at":"2026-08-13T15:27:25.430393Z","submitted_at":"2020-10-08T05:13:36Z","title":"ALFWorld: Aligning Text and Embodied Environments for Interactive Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.03768","snapshot_observed_at":"2026-08-05T23:15:50.843229Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2608.03223","last_updated":"2026-08-04T06:56:47Z","snapshot_observed_at":"2026-08-17T21:53:51.596626Z","submitted_at":"2026-08-04T06:56:47Z","title":"Agentic Reinforcement Learning with Self-Distilled Reward Shaping","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-05T23:15:50.843229Z"},"links":{"cited_paper":"/paper/2010.03768","citing_paper":"/paper/2608.03223"},"observation_digest":"sha256:c1ff5886ab651a3233f3b68c31cce081fcd20d3040228670bb542c93266d07fd","observation_id":"81c9f18d-99bd-4bcc-adde-d2766986be77","resolution":{"observed_at":"2026-08-05T23:15:50.843229Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.15189","last_updated":"2022-09-30T02:30:15Z","snapshot_observed_at":"2026-08-16T16:27:58.798107Z","submitted_at":"2022-09-30T02:30:15Z","title":"Learning by Distilling Context","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.15189","snapshot_observed_at":"2026-08-05T23:15:50.848819Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.03223","last_updated":"2026-08-04T06:56:47Z","snapshot_observed_at":"2026-08-17T21:53:51.596626Z","submitted_at":"2026-08-04T06:56:47Z","title":"Agentic Reinforcement Learning with Self-Distilled Reward Shaping","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-05T23:15:50.848819Z"},"links":{"cited_paper":"/paper/2209.15189","citing_paper":"/paper/2608.03223"},"observation_digest":"sha256:2cb67d9cc8a0763f1c179ce9c4510595d3f34355fbd6e67cf7fd5818c76b1446","observation_id":"ff8d01c5-2bd5-42d1-9e20-50c0d9be4d9a","resolution":{"observed_at":"2026-08-05T23:15:50.848819Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:15:50.853031Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03223","last_updated":"2026-08-04T06:56:47Z","snapshot_observed_at":"2026-08-17T21:53:51.596626Z","submitted_at":"2026-08-04T06:56:47Z","title":"Agentic Reinforcement Learning with Self-Distilled Reward Shaping","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-05T23:15:50.853031Z"},"links":{"citing_paper":"/paper/2608.03223"},"observation_digest":"sha256:353919c94b34237d5c4465ef4e4df604ce68a73ff0ffdac0aacb0d83fc031358","observation_id":"f9fb4306-7ed0-4c05-affa-c6e28e54c521","resolution":{"observed_at":"2026-08-05T23:15:50.853031Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:15:51.631452Z","title":null,"venue":null,"work_id":"918619d9-c0c1-4598-a41b-e53520d2cc18","year":2009},"citing_paper":{"arxiv_id":"2608.03223","last_updated":"2026-08-04T06:56:47Z","snapshot_observed_at":"2026-08-17T21:53:51.596626Z","submitted_at":"2026-08-04T06:56:47Z","title":"Agentic Reinforcement Learning with Self-Distilled Reward Shaping","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-05T23:15:50.862402Z"},"links":{"citing_paper":"/paper/2608.03223"},"observation_digest":"sha256:d046d4ab03886508d145232d6520ef21921541820023b2f08f00aee6061d4490","observation_id":"5cceeed0-e3aa-4b6f-bc35-7df47754fbee","resolution":{"observed_at":"2026-08-05T23:15:51.636021Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2604.10674","last_updated":"2026-04-12T14:57:52Z","snapshot_observed_at":"2026-08-14T14:15:55.861698Z","submitted_at":"2026-04-12T14:57:52Z","title":"Skill-SD: Skill-Conditioned Self-Distillation for Multi-turn LLM Agents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.10674","snapshot_observed_at":"2026-08-05T23:15:50.866749Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.03223","last_updated":"2026-08-04T06:56:47Z","snapshot_observed_at":"2026-08-17T21:53:51.596626Z","submitted_at":"2026-08-04T06:56:47Z","title":"Agentic Reinforcement Learning with Self-Distilled Reward Shaping","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-05T23:15:50.866749Z"},"links":{"cited_paper":"/paper/2604.10674","citing_paper":"/paper/2608.03223"},"observation_digest":"sha256:44e37e552efe1205a7d7ff7bf2eed98c64ee685109b40a61910277bf69d0230d","observation_id":"38069836-2da3-4d8a-a6ed-bf13e7a964df","resolution":{"observed_at":"2026-08-05T23:15:50.866749Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.24005","last_updated":"2026-04-29T03:05:32Z","snapshot_observed_at":"2026-08-13T09:07:17.541162Z","submitted_at":"2026-04-27T03:38:27Z","title":"TCOD: Exploring Temporal Curriculum in On-Policy Distillation for Multi-turn Autonomous Agents","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.24005","snapshot_observed_at":"2026-08-05T23:15:50.870908Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.03223","last_updated":"2026-08-04T06:56:47Z","snapshot_observed_at":"2026-08-17T21:53:51.596626Z","submitted_at":"2026-08-04T06:56:47Z","title":"Agentic Reinforcement Learning with Self-Distilled Reward Shaping","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-05T23:15:50.870908Z"},"links":{"cited_paper":"/paper/2604.24005","citing_paper":"/paper/2608.03223"},"observation_digest":"sha256:26da07e922aaae9980a1ae70a670054f4be48550520e6524b8b44cb28cf8df81","observation_id":"332f1b5f-613f-4323-b26f-5a8389fb2d4c","resolution":{"observed_at":"2026-08-05T23:15:50.870908Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:15:51.613446Z","title":null,"venue":null,"work_id":"c3be8a5e-eeff-49e7-b7bf-7577fb3aba83","year":null},"citing_paper":{"arxiv_id":"2608.03223","last_updated":"2026-08-04T06:56:47Z","snapshot_observed_at":"2026-08-17T21:53:51.596626Z","submitted_at":"2026-08-04T06:56:47Z","title":"Agentic Reinforcement Learning with Self-Distilled Reward Shaping","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-05T23:15:50.875491Z"},"links":{"citing_paper":"/paper/2608.03223"},"observation_digest":"sha256:19eff67784fc6520e3d1496ac09525d02ebd648dbc7786c5619bdd5c0ffd9d5d","observation_id":"b747ed9c-5279-4141-b5e1-09f56823bc86","resolution":{"observed_at":"2026-08-05T23:15:51.619372Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2602.08234","last_updated":"2026-02-09T03:17:17Z","snapshot_observed_at":"2026-08-16T15:35:02.889986Z","submitted_at":"2026-02-09T03:17:17Z","title":"SkillRL: Evolving Agents via Recursive Skill-Augmented Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2602.08234","snapshot_observed_at":"2026-08-05T23:15:50.886657Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.03223","last_updated":"2026-08-04T06:56:47Z","snapshot_observed_at":"2026-08-17T21:53:51.596626Z","submitted_at":"2026-08-04T06:56:47Z","title":"Agentic Reinforcement Learning with Self-Distilled Reward Shaping","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-05T23:15:50.886657Z"},"links":{"cited_paper":"/paper/2602.08234","citing_paper":"/paper/2608.03223"},"observation_digest":"sha256:78902ed61869ec29227a34c5262ba25c7a5b8aa6d1e6ff986ba466aee83a4355","observation_id":"5e49090d-7305-422a-9c4d-dbb8011c04bb","resolution":{"observed_at":"2026-08-05T23:15:50.886657Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.02208","last_updated":"2025-06-02T19:46:41Z","snapshot_observed_at":"2026-08-14T23:11:08.340188Z","submitted_at":"2025-06-02T19:46:41Z","title":"KDRL: Post-Training Reasoning LLMs via Unified Knowledge Distillation and Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.02208","snapshot_observed_at":"2026-08-05T23:15:50.891014Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.03223","last_updated":"2026-08-04T06:56:47Z","snapshot_observed_at":"2026-08-17T21:53:51.596626Z","submitted_at":"2026-08-04T06:56:47Z","title":"Agentic Reinforcement Learning with Self-Distilled Reward Shaping","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-05T23:15:50.891014Z"},"links":{"cited_paper":"/paper/2506.02208","citing_paper":"/paper/2608.03223"},"observation_digest":"sha256:1c66870de861fc4920b068ac36901ef70689e8b67547fc9c102bc38f4af60828","observation_id":"f8857167-3609-4823-94d3-4c04bdb123df","resolution":{"observed_at":"2026-08-05T23:15:50.891014Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.14084","last_updated":"2026-05-21T05:36:13Z","snapshot_observed_at":"2026-08-12T12:04:07.125000Z","submitted_at":"2026-04-15T16:58:24Z","title":"TIP: Token Importance in On-Policy Distillation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.14084","snapshot_observed_at":"2026-08-05T23:15:50.895596Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.03223","last_updated":"2026-08-04T06:56:47Z","snapshot_observed_at":"2026-08-17T21:53:51.596626Z","submitted_at":"2026-08-04T06:56:47Z","title":"Agentic Reinforcement Learning with Self-Distilled Reward Shaping","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-05T23:15:50.895596Z"},"links":{"cited_paper":"/paper/2604.14084","citing_paper":"/paper/2608.03223"},"observation_digest":"sha256:da4a8e013b29b1ac162581fb6f4539238f309ebbbcf25002b364f62042f1b21b","observation_id":"580e16ac-39d3-4085-96fb-0f8cca1a2119","resolution":{"observed_at":"2026-08-05T23:15:50.895596Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-08-05T23:15:50.901475Z","title":"Qwen3technical report","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.03223","last_updated":"2026-08-04T06:56:47Z","snapshot_observed_at":"2026-08-17T21:53:51.596626Z","submitted_at":"2026-08-04T06:56:47Z","title":"Agentic Reinforcement Learning with Self-Distilled Reward Shaping","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-05T23:15:50.901475Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2608.03223"},"observation_digest":"sha256:467084b8c774d514c4c69cf1349c3d598b3b1c44ce0e17893b2fe3f4b545d5f7","observation_id":"62ec70ad-3164-4a3f-86b3-0c610941cba0","resolution":{"observed_at":"2026-08-05T23:15:50.901475Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.03128","last_updated":"2026-04-08T08:22:36Z","snapshot_observed_at":"2026-08-03T04:49:13.270533Z","submitted_at":"2026-04-03T15:50:07Z","title":"Self-Distilled RLVR","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.03128","snapshot_observed_at":"2026-08-05T23:15:50.907312Z","title":"Self-DistilledRLVR","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.03223","last_updated":"2026-08-04T06:56:47Z","snapshot_observed_at":"2026-08-17T21:53:51.596626Z","submitted_at":"2026-08-04T06:56:47Z","title":"Agentic Reinforcement Learning with Self-Distilled Reward Shaping","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-05T23:15:50.907312Z"},"links":{"cited_paper":"/paper/2604.03128","citing_paper":"/paper/2608.03223"},"observation_digest":"sha256:0485211779cd557836b69de7b7ed2355fe5b971be6327a9de126962e714884a4","observation_id":"e73c43fc-446a-46e9-bf20-de450cbf756f","resolution":{"observed_at":"2026-08-05T23:15:50.907312Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:15:50.913796Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2608.03223","last_updated":"2026-08-04T06:56:47Z","snapshot_observed_at":"2026-08-17T21:53:51.596626Z","submitted_at":"2026-08-04T06:56:47Z","title":"Agentic Reinforcement Learning with Self-Distilled Reward Shaping","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-05T23:15:50.913796Z"},"links":{"citing_paper":"/paper/2608.03223"},"observation_digest":"sha256:07326a9e2bf43859e8a3559ab6c4dbc6d2e4117e880612d196de9a0b5ad3aafe","observation_id":"fd9b2f95-9564-4cf8-badd-dd4a3e8e1e6f","resolution":{"observed_at":"2026-08-05T23:15:50.913796Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:15:51.585175Z","title":"WebShop: Towards scalable real-world web interaction with grounded language agents","venue":null,"work_id":"d0660c85-d499-42cf-af85-fe89b29018f5","year":2022},"citing_paper":{"arxiv_id":"2608.03223","last_updated":"2026-08-04T06:56:47Z","snapshot_observed_at":"2026-08-17T21:53:51.596626Z","submitted_at":"2026-08-04T06:56:47Z","title":"Agentic Reinforcement Learning with Self-Distilled Reward Shaping","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-05T23:15:50.921335Z"},"links":{"citing_paper":"/paper/2608.03223"},"observation_digest":"sha256:4e9392ce22f33aff5dcb378f32c3a3a80d215ac635630ea4ff9c8ad6566f28b7","observation_id":"cce0ed66-ec96-4eae-b737-28ed9bc82c38","resolution":{"observed_at":"2026-08-05T23:15:51.590013Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2602.12275","last_updated":"2026-03-23T13:11:10Z","snapshot_observed_at":"2026-08-13T16:28:18.700523Z","submitted_at":"2026-02-12T18:58:28Z","title":"On-Policy Context Distillation for Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2602.12275","snapshot_observed_at":"2026-08-05T23:15:50.925900Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.03223","last_updated":"2026-08-04T06:56:47Z","snapshot_observed_at":"2026-08-17T21:53:51.596626Z","submitted_at":"2026-08-04T06:56:47Z","title":"Agentic Reinforcement Learning with Self-Distilled Reward Shaping","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-05T23:15:50.925900Z"},"links":{"cited_paper":"/paper/2602.12275","citing_paper":"/paper/2608.03223"},"observation_digest":"sha256:6c002e5d11b0bcff6ad1eb3e1e490a8b60fdf245ffc452cce54fdc9f95f047bd","observation_id":"b3da775b-c531-4833-81db-c3208aff0302","resolution":{"observed_at":"2026-08-05T23:15:50.925900Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2601.18734","last_updated":"2026-03-20T15:40:19Z","snapshot_observed_at":"2026-08-13T14:47:47.249767Z","submitted_at":"2026-01-26T17:56:50Z","title":"Self-Distilled Reasoner: On-Policy Self-Distillation for Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2601.18734","snapshot_observed_at":"2026-08-05T23:15:50.932630Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.03223","last_updated":"2026-08-04T06:56:47Z","snapshot_observed_at":"2026-08-17T21:53:51.596626Z","submitted_at":"2026-08-04T06:56:47Z","title":"Agentic Reinforcement Learning with Self-Distilled Reward Shaping","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-05T23:15:50.932630Z"},"links":{"cited_paper":"/paper/2601.18734","citing_paper":"/paper/2608.03223"},"observation_digest":"sha256:f9e547900c6c4a727a38ea797eb86bac05f287423233d14e80990a1d385126c3","observation_id":"e5ec1a51-7670-44cb-ae15-62522eb0765f","resolution":{"observed_at":"2026-08-05T23:15:50.932630Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-08-15T20:26:32.102285Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-05T23:15:50.832775Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2608.03223","last_updated":"2026-08-04T06:56:47Z","snapshot_observed_at":"2026-08-17T21:53:51.596626Z","submitted_at":"2026-08-04T06:56:47Z","title":"Agentic Reinforcement Learning with Self-Distilled Reward Shaping","version":1},"reference_index":2017,"source":"pdf_text","source_observed_at":"2026-08-05T23:15:50.832775Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2608.03223"},"observation_digest":"sha256:1b77f015ff4c41237bc0a205e5a7e26f57b9b1db74d46d231764c79a2d8dbb2f","observation_id":"24d858c6-4fac-43ac-9b1d-6f58d24bf818","resolution":{"observed_at":"2026-08-05T23:15:50.832775Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:15:51.648639Z","title":"Transactions of the Association for Computational Linguistics10 (2022), 539–554","venue":null,"work_id":"372e8cea-0678-44af-ad2c-399a381cabe2","year":2022},"citing_paper":{"arxiv_id":"2608.03223","last_updated":"2026-08-04T06:56:47Z","snapshot_observed_at":"2026-08-17T21:53:51.596626Z","submitted_at":"2026-08-04T06:56:47Z","title":"Agentic Reinforcement Learning with Self-Distilled Reward Shaping","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-05T23:15:50.857722Z"},"links":{"citing_paper":"/paper/2608.03223"},"observation_digest":"sha256:cb5689dd092f04cf1a3f8539c790f1600e678a94b542a05f28c2e51aad242a3e","observation_id":"73286c70-c049-4d27-ad0f-0f428c56a001","resolution":{"observed_at":"2026-08-05T23:15:51.654412Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.20073","last_updated":"2025-05-26T17:19:30Z","snapshot_observed_at":"2026-08-13T08:41:26.093022Z","submitted_at":"2025-04-24T17:57:08Z","title":"RAGEN: Understanding Self-Evolution in LLM Agents via Multi-Turn Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.20073","snapshot_observed_at":"2026-08-05T23:15:50.881548Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.03223","last_updated":"2026-08-04T06:56:47Z","snapshot_observed_at":"2026-08-17T21:53:51.596626Z","submitted_at":"2026-08-04T06:56:47Z","title":"Agentic Reinforcement Learning with Self-Distilled Reward Shaping","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-05T23:15:50.881548Z"},"links":{"cited_paper":"/paper/2504.20073","citing_paper":"/paper/2608.03223"},"observation_digest":"sha256:361f15ee4e984e5e3c0d0ee2f37ab43e58e1d78dc3747962f3848f431d12b48b","observation_id":"d9033018-4208-4139-a8c5-f5fe7d1a2488","resolution":{"observed_at":"2026-08-05T23:15:50.881548Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2608.03223","last_updated":"2026-08-04T06:56:47Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-17T21:53:51.596626Z","submitted_at":"2026-08-04T06:56:47Z","title":"Agentic Reinforcement Learning with Self-Distilled Reward Shaping"},"reference_resolution":{"displayed":43,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":37,"verified_exact":1,"verified_fuzzy":4},"total_outbound_references":43},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"thesis":"As of 18 August 2026, this Paper Citation Record lists 43 of 43 outbound references and 0 inbound Pith citation observations for arXiv:2608.03223."}