{"as_of":"2026-08-20T15:02:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:f89959e6e9e4c1ca685b2315f8f3c5838e70616ab3b804311698a40e576557b2","coverage":[{"denominator":74,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":74,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-02T01:10:21.309226Z","state":"measured"},{"denominator":79,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":79,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-20T06:33:59.587034+00:00","state":"measured"},{"denominator":5,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":5,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T19:53:25.906690Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-06T16:39:07.928445Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2607.14777","last_updated":"2026-07-16T09:57:18Z","snapshot_observed_at":"2026-08-20T01:11:29.310491Z","submitted_at":"2026-07-16T09:57:18Z","title":"SEED: Self-Evolving On-Policy Distillation for Agentic Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2607.14777","snapshot_observed_at":"2026-08-03T15:30:02.812777Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.29010","last_updated":"2026-07-31T04:24:16Z","snapshot_observed_at":"2026-08-18T09:12:13.607797Z","submitted_at":"2026-07-31T04:24:16Z","title":"EvoReason: Self-Evolving Reasoning Primitive-Guided On-Policy Distillation for Latent Reasoning in Generative Recommendation","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-03T15:30:02.812777Z"},"links":{"cited_paper":"/paper/2607.14777","citing_paper":"/paper/2607.29010"},"observation_digest":"sha256:febaa76e651d2af86fdec25a578be36f6606cff06a8cb7a331c7a6df04ed2cdb","observation_id":"2530b23c-e47a-438c-ba50-134125a446bb","resolution":{"observed_at":"2026-08-03T15:30:02.812777Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2607.14777","last_updated":"2026-07-16T09:57:18Z","snapshot_observed_at":"2026-08-20T01:11:29.310491Z","submitted_at":"2026-07-16T09:57:18Z","title":"SEED: Self-Evolving On-Policy Distillation for Agentic Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2607.14777","snapshot_observed_at":"2026-08-03T09:20:20.130244Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.29320","last_updated":"2026-07-31T11:51:04Z","snapshot_observed_at":"2026-08-19T15:30:40.447277Z","submitted_at":"2026-07-31T11:51:04Z","title":"MAGA: Multi-Platform Self-Fusion of GUI Agents via Structured Action Distillation","version":1},"reference_index":82,"source":"arxiv_source","source_observed_at":"2026-08-03T09:20:20.130244Z"},"links":{"cited_paper":"/paper/2607.14777","citing_paper":"/paper/2607.29320"},"observation_digest":"sha256:0309b75f1a3d6fe5bb0678b821ae88369a9d4c7a3d211428b780212699ff32c5","observation_id":"ab03c17b-e6c7-45cb-9dca-f1fb3855e2d1","resolution":{"observed_at":"2026-08-03T09:20:20.130244Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2607.14777","last_updated":"2026-07-16T09:57:18Z","snapshot_observed_at":"2026-08-20T01:11:29.310491Z","submitted_at":"2026-07-16T09:57:18Z","title":"SEED: Self-Evolving On-Policy Distillation for Agentic Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2607.14777","snapshot_observed_at":"2026-08-04T19:59:00.309548Z","title":"Yang,A.;Li,A.;Yang,B.;Zhang,B.;Hui,B.;Zheng,B.;Yu, B.;Gao,C.;Huang,C.;Lv,C.;etal.2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.01837","last_updated":"2026-08-03T07:47:59Z","snapshot_observed_at":"2026-08-19T11:40:46.347368Z","submitted_at":"2026-08-03T07:47:59Z","title":"PCSD: Persistent Consistency for Self-Distillation in Agentic Reinforcement Learning","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-04T19:59:00.309548Z"},"links":{"cited_paper":"/paper/2607.14777","citing_paper":"/paper/2608.01837"},"observation_digest":"sha256:8b858723f01fe85c2ff347d707b7a5fbc7cc755872c35da0cf6e4fb1f97e2164","observation_id":"ae6bd321-e27e-454b-8cf6-342a6b55124e","resolution":{"observed_at":"2026-08-04T19:59:00.309548Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2607.14777","last_updated":"2026-07-16T09:57:18Z","snapshot_observed_at":"2026-08-20T01:11:29.310491Z","submitted_at":"2026-07-16T09:57:18Z","title":"SEED: Self-Evolving On-Policy Distillation for Agentic Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2607.14777","doi":null,"metadata_source":"pith","pith_arxiv_id":"2607.14777","snapshot_observed_at":"2026-08-06T16:39:07.928445Z","title":"SEED: Self-Evolving On-Policy Distillation for Agentic Reinforcement Learning","venue":"cs.CL","work_id":"c0647c25-9e3b-48a6-b87c-477f63756d60","year":2026},"citing_paper":{"arxiv_id":"2608.04788","last_updated":"2026-08-05T12:52:14Z","snapshot_observed_at":"2026-08-17T07:24:45.393773Z","submitted_at":"2026-08-05T12:52:14Z","title":"Agentic Reinforcement Learning with Observation-Calibrated Self-Distillation","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T16:39:06.711304Z"},"links":{"cited_paper":"/paper/2607.14777","citing_paper":"/paper/2608.04788"},"observation_digest":"sha256:10ea99b07a30c03526a99f0192c089fd61ad49514d27a8d6c0269996f58da4fe","observation_id":"a54fa22c-d4a9-4e5c-b091-7fcec56b98e6","resolution":{"observed_at":"2026-08-06T16:39:08.054402Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2607.14777","last_updated":"2026-07-16T09:57:18Z","snapshot_observed_at":"2026-08-20T01:11:29.310491Z","submitted_at":"2026-07-16T09:57:18Z","title":"SEED: Self-Evolving On-Policy Distillation for Agentic Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2607.14777","snapshot_observed_at":"2026-08-07T19:53:25.906690Z","title":"arXiv preprint arXiv:2607.14777 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05987","last_updated":"2026-08-06T13:00:59Z","snapshot_observed_at":"2026-08-19T04:06:23.917154Z","submitted_at":"2026-08-06T13:00:59Z","title":"AgentOPSD: Recursive Self-Distillation for Agentic Reinforcement Learning","version":1},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-08-07T19:53:25.906690Z"},"links":{"cited_paper":"/paper/2607.14777","citing_paper":"/paper/2608.05987"},"observation_digest":"sha256:dad799ffda228f24991847c2b3d4827c5b742d961d0f73747d8c59dd8bc12960","observation_id":"0c69cbd7-d25b-445e-a4ff-0cc00bd9f76b","resolution":{"observed_at":"2026-08-07T19:53:25.906690Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2607.14777/citation-record","integrity":"/paper/2607.14777/integrity","json":"/paper/2607.14777/citation-record.json","paper":"/paper/2607.14777"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T01:10:21.056279Z","title":"Frontiers of Computer Science , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.14777","last_updated":"2026-07-16T09:57:18Z","snapshot_observed_at":"2026-08-20T01:11:29.310491Z","submitted_at":"2026-07-16T09:57:18Z","title":"SEED: Self-Evolving On-Policy Distillation for Agentic Reinforcement Learning","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-02T01:10:21.056279Z"},"links":{"citing_paper":"/paper/2607.14777"},"observation_digest":"sha256:2c4c48bc42f71beda4ce07849722cbd8689939416f679455a3971198a6826768","observation_id":"a03c48b1-cd15-4d44-8254-c88cd72f9b0b","resolution":{"observed_at":"2026-08-02T01:10:21.056279Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T01:10:21.060602Z","title":"Science China Information Sciences , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.14777","last_updated":"2026-07-16T09:57:18Z","snapshot_observed_at":"2026-08-20T01:11:29.310491Z","submitted_at":"2026-07-16T09:57:18Z","title":"SEED: Self-Evolving On-Policy Distillation for Agentic Reinforcement Learning","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-02T01:10:21.060602Z"},"links":{"citing_paper":"/paper/2607.14777"},"observation_digest":"sha256:f7b9f9a5c6d9d43feaa4fb56d6eca0528fb97120fe894d5dd129cc1955ad1a78","observation_id":"c72e6d0e-3cab-46ec-b6ee-40506578a36c","resolution":{"observed_at":"2026-08-02T01:10:21.060602Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T01:10:21.064601Z","title":"2023 , url =","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.14777","last_updated":"2026-07-16T09:57:18Z","snapshot_observed_at":"2026-08-20T01:11:29.310491Z","submitted_at":"2026-07-16T09:57:18Z","title":"SEED: Self-Evolving On-Policy Distillation for Agentic Reinforcement Learning","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-02T01:10:21.064601Z"},"links":{"citing_paper":"/paper/2607.14777"},"observation_digest":"sha256:c800d67aa8eb0d86270947d64419f7673db71008418f63a01047d6d68759ad20","observation_id":"8b2c3d6e-284e-48e1-9e3b-15e6679d8e84","resolution":{"observed_at":"2026-08-02T01:10:21.064601Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T01:10:21.067985Z","title":"Advances in Neural Information Processing Systems , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.14777","last_updated":"2026-07-16T09:57:18Z","snapshot_observed_at":"2026-08-20T01:11:29.310491Z","submitted_at":"2026-07-16T09:57:18Z","title":"SEED: Self-Evolving On-Policy Distillation for Agentic Reinforcement Learning","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-02T01:10:21.067985Z"},"links":{"citing_paper":"/paper/2607.14777"},"observation_digest":"sha256:88410952096c60417a01d450aaf7168eda872ddbd24084c255120fcf3dd6e6ca","observation_id":"152a5d64-f8ea-47f1-9d85-d4258411fbe1","resolution":{"observed_at":"2026-08-02T01:10:21.067985Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T01:10:21.071848Z","title":"and Zhang, Tianjun and Wang, Xin and Gonzalez, Joseph E","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.14777","last_updated":"2026-07-16T09:57:18Z","snapshot_observed_at":"2026-08-20T01:11:29.310491Z","submitted_at":"2026-07-16T09:57:18Z","title":"SEED: Self-Evolving On-Policy Distillation for Agentic Reinforcement Learning","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-02T01:10:21.071848Z"},"links":{"citing_paper":"/paper/2607.14777"},"observation_digest":"sha256:088c0dfedd113021a44a501872a6497f8805bb30a11d385d21308b6482a11611","observation_id":"f6da2a51-3815-47c8-995e-353edaf50a2a","resolution":{"observed_at":"2026-08-02T01:10:21.071848Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.03688","last_updated":"2025-10-04T03:54:18Z","snapshot_observed_at":"2026-08-20T10:21:12.032735Z","submitted_at":"2023-08-07T16:08:11Z","title":"AgentBench: Evaluating LLMs as Agents","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.03688","snapshot_observed_at":"2026-08-02T01:10:21.075066Z","title":"AgentBench: Evaluating","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.14777","last_updated":"2026-07-16T09:57:18Z","snapshot_observed_at":"2026-08-20T01:11:29.310491Z","submitted_at":"2026-07-16T09:57:18Z","title":"SEED: Self-Evolving On-Policy Distillation for Agentic Reinforcement Learning","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-02T01:10:21.075066Z"},"links":{"cited_paper":"/paper/2308.03688","citing_paper":"/paper/2607.14777"},"observation_digest":"sha256:3443b5a3d3acc152792852da3df22b6a567b649813876852f3a2cd4ff163ead1","observation_id":"735f7248-9106-4fb7-85d5-96a9e5dba52b","resolution":{"observed_at":"2026-08-02T01:10:21.075066Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T01:10:21.078656Z","title":"International Conference on Learning Representations , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.14777","last_updated":"2026-07-16T09:57:18Z","snapshot_observed_at":"2026-08-20T01:11:29.310491Z","submitted_at":"2026-07-16T09:57:18Z","title":"SEED: Self-Evolving On-Policy Distillation for Agentic Reinforcement Learning","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-02T01:10:21.078656Z"},"links":{"citing_paper":"/paper/2607.14777"},"observation_digest":"sha256:b4411532d3d226ed5af7358b284ecde9ae1b81bf1e8ebaac2aff7d9184a912d7","observation_id":"e3544c73-9a32-41bd-83c1-9a1c3fa04c38","resolution":{"observed_at":"2026-08-02T01:10:21.078656Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T01:10:21.082487Z","title":"2022 , url =","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.14777","last_updated":"2026-07-16T09:57:18Z","snapshot_observed_at":"2026-08-20T01:11:29.310491Z","submitted_at":"2026-07-16T09:57:18Z","title":"SEED: Self-Evolving On-Policy Distillation for Agentic Reinforcement Learning","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-02T01:10:21.082487Z"},"links":{"citing_paper":"/paper/2607.14777"},"observation_digest":"sha256:8730a0d43f445ae1c3fc79a47952dd00c19dac2028ab22b21855ebd7ca1e3fae","observation_id":"1314b44e-ecc8-456a-8ab7-a645069c1df4","resolution":{"observed_at":"2026-08-02T01:10:21.082487Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T01:10:21.085614Z","title":"2023 , url =","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.14777","last_updated":"2026-07-16T09:57:18Z","snapshot_observed_at":"2026-08-20T01:11:29.310491Z","submitted_at":"2026-07-16T09:57:18Z","title":"SEED: Self-Evolving On-Policy Distillation for Agentic Reinforcement Learning","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-02T01:10:21.085614Z"},"links":{"citing_paper":"/paper/2607.14777"},"observation_digest":"sha256:8b1fea298c103c0992c723fc5bf94b0c942636e506e15a1ab5c0774587d501ab","observation_id":"fadb58b4-bc51-45b9-8d8f-3f92ea4a6d6d","resolution":{"observed_at":"2026-08-02T01:10:21.085614Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T01:10:21.089481Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.14777","last_updated":"2026-07-16T09:57:18Z","snapshot_observed_at":"2026-08-20T01:11:29.310491Z","submitted_at":"2026-07-16T09:57:18Z","title":"SEED: Self-Evolving On-Policy Distillation for Agentic Reinforcement Learning","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-02T01:10:21.089481Z"},"links":{"citing_paper":"/paper/2607.14777"},"observation_digest":"sha256:707078413fc0e35c4c4f171bff49e00cc744b9ce0d96394abab18c2fb644bfd3","observation_id":"cdb03de1-827e-423b-a58d-9b64f9ff13b0","resolution":{"observed_at":"2026-08-02T01:10:21.089481Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T01:10:21.092942Z","title":"and Yang, John and Wettig, Alexander and Yao, Shunyu and Pei, Kexin and Press, Ofir and Narasimhan, Karthik , booktitle =","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.14777","last_updated":"2026-07-16T09:57:18Z","snapshot_observed_at":"2026-08-20T01:11:29.310491Z","submitted_at":"2026-07-16T09:57:18Z","title":"SEED: Self-Evolving On-Policy Distillation for Agentic Reinforcement Learning","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-02T01:10:21.092942Z"},"links":{"citing_paper":"/paper/2607.14777"},"observation_digest":"sha256:37da58cd90843348ee0826db915e64a7b1f760390e4a663671b35e999137bd12","observation_id":"c2a3ee49-38d9-4e0c-be0b-8967527162ab","resolution":{"observed_at":"2026-08-02T01:10:21.092942Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T01:10:21.096970Z","title":"2024 , url =","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.14777","last_updated":"2026-07-16T09:57:18Z","snapshot_observed_at":"2026-08-20T01:11:29.310491Z","submitted_at":"2026-07-16T09:57:18Z","title":"SEED: Self-Evolving On-Policy Distillation for Agentic Reinforcement Learning","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-02T01:10:21.096970Z"},"links":{"citing_paper":"/paper/2607.14777"},"observation_digest":"sha256:af897b43a66e3e99628172433c0fb629950eaba11b357155aeefaaaf0cdd4600","observation_id":"d635e683-85f3-4f99-a6ab-f7e55e92cf7b","resolution":{"observed_at":"2026-08-02T01:10:21.096970Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.09516","last_updated":"2025-08-05T19:08:38Z","snapshot_observed_at":"2026-08-15T13:17:00.526689Z","submitted_at":"2025-03-12T16:26:39Z","title":"Search-R1: Training LLMs to Reason and Leverage Search Engines with Reinforcement Learning","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.09516","snapshot_observed_at":"2026-08-02T01:10:21.100716Z","title":"2503.09516 , archivePrefix =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.14777","last_updated":"2026-07-16T09:57:18Z","snapshot_observed_at":"2026-08-20T01:11:29.310491Z","submitted_at":"2026-07-16T09:57:18Z","title":"SEED: Self-Evolving On-Policy Distillation for Agentic Reinforcement Learning","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-02T01:10:21.100716Z"},"links":{"cited_paper":"/paper/2503.09516","citing_paper":"/paper/2607.14777"},"observation_digest":"sha256:220a60e1ddf60cc0f104ba772bcc32ca2eea1ec8f5a5554ea38732f323cadc04","observation_id":"fb257b68-31f4-4103-85d1-ef3270f9456f","resolution":{"observed_at":"2026-08-02T01:10:21.100716Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T01:10:21.104307Z","title":"Transactions of the Association for Computational Linguistics , volume =","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.14777","last_updated":"2026-07-16T09:57:18Z","snapshot_observed_at":"2026-08-20T01:11:29.310491Z","submitted_at":"2026-07-16T09:57:18Z","title":"SEED: Self-Evolving On-Policy Distillation for Agentic Reinforcement Learning","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-02T01:10:21.104307Z"},"links":{"citing_paper":"/paper/2607.14777"},"observation_digest":"sha256:942eff7c7fa151f08dad0ea21406ac82044dc74ebd198705f5e51a42f71278e4","observation_id":"03e31e2b-db01-49f5-a0d9-721d3bfd7ac2","resolution":{"observed_at":"2026-08-02T01:10:21.104307Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T01:10:21.107292Z","title":"2017 , doi =","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.14777","last_updated":"2026-07-16T09:57:18Z","snapshot_observed_at":"2026-08-20T01:11:29.310491Z","submitted_at":"2026-07-16T09:57:18Z","title":"SEED: Self-Evolving On-Policy Distillation for Agentic Reinforcement Learning","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-02T01:10:21.107292Z"},"links":{"citing_paper":"/paper/2607.14777"},"observation_digest":"sha256:8066411910090944df78254be42fd10710cdd241f868783f806802910697ba84","observation_id":"aa2cffdd-89c4-4a7b-a48a-739fd4ef3717","resolution":{"observed_at":"2026-08-02T01:10:21.107292Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T01:10:21.110036Z","title":"Proceedings of the 61st Annual Meeting of the Association for Computational Linguistics , pages =","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.14777","last_updated":"2026-07-16T09:57:18Z","snapshot_observed_at":"2026-08-20T01:11:29.310491Z","submitted_at":"2026-07-16T09:57:18Z","title":"SEED: Self-Evolving On-Policy Distillation for Agentic Reinforcement Learning","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-02T01:10:21.110036Z"},"links":{"citing_paper":"/paper/2607.14777"},"observation_digest":"sha256:7713898781efa0134d5f54d683705b18fe1a646232e67126f9f04a339bbe011f","observation_id":"4e832734-d4b2-4633-83e7-b6dd533798ca","resolution":{"observed_at":"2026-08-02T01:10:21.110036Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T01:10:21.113579Z","title":", booktitle =","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.14777","last_updated":"2026-07-16T09:57:18Z","snapshot_observed_at":"2026-08-20T01:11:29.310491Z","submitted_at":"2026-07-16T09:57:18Z","title":"SEED: Self-Evolving On-Policy Distillation for Agentic Reinforcement Learning","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-02T01:10:21.113579Z"},"links":{"citing_paper":"/paper/2607.14777"},"observation_digest":"sha256:be743beeb78980ca2e77a0685693c088c48f8506a4bd46026a214deab3e4c788","observation_id":"e8c86843-8607-424a-8731-9d2d5dd9c9e4","resolution":{"observed_at":"2026-08-02T01:10:21.113579Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T01:10:21.117305Z","title":"Constructing A Multi-hop","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.14777","last_updated":"2026-07-16T09:57:18Z","snapshot_observed_at":"2026-08-20T01:11:29.310491Z","submitted_at":"2026-07-16T09:57:18Z","title":"SEED: Self-Evolving On-Policy Distillation for Agentic Reinforcement Learning","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-02T01:10:21.117305Z"},"links":{"citing_paper":"/paper/2607.14777"},"observation_digest":"sha256:e8b7619035430414493ab9cf54c149a51cb0788ffb62401983869cd92f66df65","observation_id":"023c511b-a824-4c9a-bcac-9d2c93dbff43","resolution":{"observed_at":"2026-08-02T01:10:21.117305Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T01:10:21.121110Z","title":"2022 , doi =","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.14777","last_updated":"2026-07-16T09:57:18Z","snapshot_observed_at":"2026-08-20T01:11:29.310491Z","submitted_at":"2026-07-16T09:57:18Z","title":"SEED: Self-Evolving On-Policy Distillation for Agentic Reinforcement Learning","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-02T01:10:21.121110Z"},"links":{"citing_paper":"/paper/2607.14777"},"observation_digest":"sha256:a96eb32d472141586936a42e957cca41f6e36e6baec6f9574bd289e9a75fc393","observation_id":"b56077fd-e7f8-424b-be3c-07d6e345a943","resolution":{"observed_at":"2026-08-02T01:10:21.121110Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T01:10:21.125187Z","title":"Findings of the Association for Computational Linguistics: EMNLP 2023 , pages =","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.14777","last_updated":"2026-07-16T09:57:18Z","snapshot_observed_at":"2026-08-20T01:11:29.310491Z","submitted_at":"2026-07-16T09:57:18Z","title":"SEED: Self-Evolving On-Policy Distillation for Agentic Reinforcement Learning","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-02T01:10:21.125187Z"},"links":{"citing_paper":"/paper/2607.14777"},"observation_digest":"sha256:ea18fcf6cf615f577fca5edd0b9343b55c1339dc47002c65cbe4f2c9d21bb7b8","observation_id":"6adbdda8-0d87-4ade-b897-d5e465d1cca4","resolution":{"observed_at":"2026-08-02T01:10:21.125187Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T01:10:21.128541Z","title":"Advances in Neural Information Processing Systems , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.14777","last_updated":"2026-07-16T09:57:18Z","snapshot_observed_at":"2026-08-20T01:11:29.310491Z","submitted_at":"2026-07-16T09:57:18Z","title":"SEED: Self-Evolving On-Policy Distillation for Agentic Reinforcement Learning","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-02T01:10:21.128541Z"},"links":{"citing_paper":"/paper/2607.14777"},"observation_digest":"sha256:de66bd647fd99c4acbeae314d670df5bc33cc48e6522236581b6dfe8887e51c7","observation_id":"72da754a-404e-497f-b56c-6fda9e9ae218","resolution":{"observed_at":"2026-08-02T01:10:21.128541Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-02T01:10:21.131519Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.14777","last_updated":"2026-07-16T09:57:18Z","snapshot_observed_at":"2026-08-20T01:11:29.310491Z","submitted_at":"2026-07-16T09:57:18Z","title":"SEED: Self-Evolving On-Policy Distillation for Agentic Reinforcement Learning","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-02T01:10:21.131519Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2607.14777"},"observation_digest":"sha256:9624566fa00a8bbe6ef1a6750a1c6967229cd47097dc04625e16d09b34b50db7","observation_id":"f3ffc495-9d64-4fc6-84d8-312a3d99acb2","resolution":{"observed_at":"2026-08-02T01:10:21.131519Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.20073","last_updated":"2025-05-26T17:19:30Z","snapshot_observed_at":"2026-08-13T08:41:26.093022Z","submitted_at":"2025-04-24T17:57:08Z","title":"RAGEN: Understanding Self-Evolution in LLM Agents via Multi-Turn Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.20073","snapshot_observed_at":"2026-08-02T01:10:21.134716Z","title":"2504.20073 , archivePrefix =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.14777","last_updated":"2026-07-16T09:57:18Z","snapshot_observed_at":"2026-08-20T01:11:29.310491Z","submitted_at":"2026-07-16T09:57:18Z","title":"SEED: Self-Evolving On-Policy Distillation for Agentic Reinforcement Learning","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-02T01:10:21.134716Z"},"links":{"cited_paper":"/paper/2504.20073","citing_paper":"/paper/2607.14777"},"observation_digest":"sha256:e4f4280c7d53bfd3a6c46e6ae01d3c236f7fcc42ff220fb091d04f6e14c5243a","observation_id":"be013677-665f-491e-bb22-7ae8ab1adb42","resolution":{"observed_at":"2026-08-02T01:10:21.134716Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.03680","last_updated":"2025-08-05T17:50:13Z","snapshot_observed_at":"2026-08-15T03:48:34.730767Z","submitted_at":"2025-08-05T17:50:13Z","title":"Agent Lightning: Train ANY AI Agents with Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.03680","snapshot_observed_at":"2026-08-02T01:10:21.137852Z","title":"and Yang, Yuqing , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.14777","last_updated":"2026-07-16T09:57:18Z","snapshot_observed_at":"2026-08-20T01:11:29.310491Z","submitted_at":"2026-07-16T09:57:18Z","title":"SEED: Self-Evolving On-Policy Distillation for Agentic Reinforcement Learning","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-02T01:10:21.137852Z"},"links":{"cited_paper":"/paper/2508.03680","citing_paper":"/paper/2607.14777"},"observation_digest":"sha256:2c07fc159d194183e9ca56597ff21021a36be3076da1707c7c51453f09c2b3b7","observation_id":"617abad4-a511-40ae-8edb-cad265016600","resolution":{"observed_at":"2026-08-02T01:10:21.137852Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T01:10:21.141619Z","title":"2017 , eprint =","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.14777","last_updated":"2026-07-16T09:57:18Z","snapshot_observed_at":"2026-08-20T01:11:29.310491Z","submitted_at":"2026-07-16T09:57:18Z","title":"SEED: Self-Evolving On-Policy Distillation for Agentic Reinforcement Learning","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-02T01:10:21.141619Z"},"links":{"citing_paper":"/paper/2607.14777"},"observation_digest":"sha256:e7d95c26c8faaffbc2fab74a0daac07db3ec5b4ec22ffc4a42b1052be275bf77","observation_id":"59c1fd48-65c8-411c-87e9-d3d7961c1f04","resolution":{"observed_at":"2026-08-02T01:10:21.141619Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T01:10:21.145229Z","title":"International Conference on Learning Representations , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.14777","last_updated":"2026-07-16T09:57:18Z","snapshot_observed_at":"2026-08-20T01:11:29.310491Z","submitted_at":"2026-07-16T09:57:18Z","title":"SEED: Self-Evolving On-Policy Distillation for Agentic Reinforcement Learning","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-02T01:10:21.145229Z"},"links":{"citing_paper":"/paper/2607.14777"},"observation_digest":"sha256:37297522ee157bd7e56931f6f508b209e295ec70f0120f87e385c36553636353","observation_id":"523e20dd-e4d8-4779-a714-f31c5c969389","resolution":{"observed_at":"2026-08-02T01:10:21.145229Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T01:10:21.148791Z","title":"and Gillhofer, Michael and Widrich, Michael and Unterthiner, Thomas and Brandstetter, Johannes and Hochreiter, Sepp , booktitle =","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.14777","last_updated":"2026-07-16T09:57:18Z","snapshot_observed_at":"2026-08-20T01:11:29.310491Z","submitted_at":"2026-07-16T09:57:18Z","title":"SEED: Self-Evolving On-Policy Distillation for Agentic Reinforcement Learning","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-02T01:10:21.148791Z"},"links":{"citing_paper":"/paper/2607.14777"},"observation_digest":"sha256:8b34502eea50f4dbae947ce676f4b3de59726f2a0be22ffb5f8fc53795ef4d47","observation_id":"0e4eda5e-ab2f-4102-bd2e-8e91cb38d2a5","resolution":{"observed_at":"2026-08-02T01:10:21.148791Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T01:10:21.152437Z","title":"The Landscape of Agentic Reinforcement Learning for","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.14777","last_updated":"2026-07-16T09:57:18Z","snapshot_observed_at":"2026-08-20T01:11:29.310491Z","submitted_at":"2026-07-16T09:57:18Z","title":"SEED: Self-Evolving On-Policy Distillation for Agentic Reinforcement Learning","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-02T01:10:21.152437Z"},"links":{"citing_paper":"/paper/2607.14777"},"observation_digest":"sha256:31a5255b04011903648931a9a309c98912b0630cc5a7abae564951b5e4cb2226","observation_id":"84763708-eda6-4e65-b896-49058a11f9d2","resolution":{"observed_at":"2026-08-02T01:10:21.152437Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T01:10:21.156035Z","title":"2022 , eprint =","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.14777","last_updated":"2026-07-16T09:57:18Z","snapshot_observed_at":"2026-08-20T01:11:29.310491Z","submitted_at":"2026-07-16T09:57:18Z","title":"SEED: Self-Evolving On-Policy Distillation for Agentic Reinforcement Learning","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-02T01:10:21.156035Z"},"links":{"citing_paper":"/paper/2607.14777"},"observation_digest":"sha256:0e44545d86f38a5c1f77393d22b6c2f0249e62338286551a260adf8fdbd45ac8","observation_id":"80965d57-ab3a-4619-a89a-834df7f72f08","resolution":{"observed_at":"2026-08-02T01:10:21.156035Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T01:10:21.159439Z","title":"International Conference on Learning Representations , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.14777","last_updated":"2026-07-16T09:57:18Z","snapshot_observed_at":"2026-08-20T01:11:29.310491Z","submitted_at":"2026-07-16T09:57:18Z","title":"SEED: Self-Evolving On-Policy Distillation for Agentic Reinforcement Learning","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-02T01:10:21.159439Z"},"links":{"citing_paper":"/paper/2607.14777"},"observation_digest":"sha256:b28d02ac99ebba5179d23d8c8ec5a0f520b69c8d0b50629deff126a9babbc0c0","observation_id":"3f07c628-a40b-4ac7-824d-f2385a44f6c0","resolution":{"observed_at":"2026-08-02T01:10:21.159439Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T01:10:21.162828Z","title":"2021 , eprint =","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.14777","last_updated":"2026-07-16T09:57:18Z","snapshot_observed_at":"2026-08-20T01:11:29.310491Z","submitted_at":"2026-07-16T09:57:18Z","title":"SEED: Self-Evolving On-Policy Distillation for Agentic Reinforcement Learning","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-02T01:10:21.162828Z"},"links":{"citing_paper":"/paper/2607.14777"},"observation_digest":"sha256:f3bd5a8db1e5a08e52307f80ae6726368bf4f481abaa2804d8fb2b09c844800f","observation_id":"495aef61-8b5d-4f23-b167-ca8f305b7252","resolution":{"observed_at":"2026-08-02T01:10:21.162828Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T01:10:21.166830Z","title":"Advances in Neural Information Processing Systems , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.14777","last_updated":"2026-07-16T09:57:18Z","snapshot_observed_at":"2026-08-20T01:11:29.310491Z","submitted_at":"2026-07-16T09:57:18Z","title":"SEED: Self-Evolving On-Policy Distillation for Agentic Reinforcement Learning","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-02T01:10:21.166830Z"},"links":{"citing_paper":"/paper/2607.14777"},"observation_digest":"sha256:2cc6715d2351706681f9a3449a84612682a59e15ba0c6b14e36996264e37bf2c","observation_id":"0d8485aa-538a-43ba-92d7-ef68f0af247d","resolution":{"observed_at":"2026-08-02T01:10:21.166830Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T01:10:21.170574Z","title":"2024 , url =","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.14777","last_updated":"2026-07-16T09:57:18Z","snapshot_observed_at":"2026-08-20T01:11:29.310491Z","submitted_at":"2026-07-16T09:57:18Z","title":"SEED: Self-Evolving On-Policy Distillation for Agentic Reinforcement Learning","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-02T01:10:21.170574Z"},"links":{"citing_paper":"/paper/2607.14777"},"observation_digest":"sha256:d890dda8bc650c4890343c91794eb37ac36c6c4645c47ce6e23bc71f1a975e83","observation_id":"58e38d23-177f-4eed-8343-7b3981afaedc","resolution":{"observed_at":"2026-08-02T01:10:21.170574Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T01:10:21.173954Z","title":"2023 , eprint =","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.14777","last_updated":"2026-07-16T09:57:18Z","snapshot_observed_at":"2026-08-20T01:11:29.310491Z","submitted_at":"2026-07-16T09:57:18Z","title":"SEED: Self-Evolving On-Policy Distillation for Agentic Reinforcement Learning","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-02T01:10:21.173954Z"},"links":{"citing_paper":"/paper/2607.14777"},"observation_digest":"sha256:015d77622c9d36e0c71d330c920480a263cfb2408c1dbe9ffa574a1cb81deceb","observation_id":"decc5674-ad4b-488b-aacf-5882aa543028","resolution":{"observed_at":"2026-08-02T01:10:21.173954Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T01:10:21.176966Z","title":"Advances in Neural Information Processing Systems , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.14777","last_updated":"2026-07-16T09:57:18Z","snapshot_observed_at":"2026-08-20T01:11:29.310491Z","submitted_at":"2026-07-16T09:57:18Z","title":"SEED: Self-Evolving On-Policy Distillation for Agentic Reinforcement Learning","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-02T01:10:21.176966Z"},"links":{"citing_paper":"/paper/2607.14777"},"observation_digest":"sha256:71b4c69c4b650b2d59d3760b623873d8ba5a251d321d30e05bdd0ac7c29cfdb7","observation_id":"082d9a64-5642-4318-b68a-7d791e29e82d","resolution":{"observed_at":"2026-08-02T01:10:21.176966Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T01:10:21.180101Z","title":"2015 , eprint =","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2607.14777","last_updated":"2026-07-16T09:57:18Z","snapshot_observed_at":"2026-08-20T01:11:29.310491Z","submitted_at":"2026-07-16T09:57:18Z","title":"SEED: Self-Evolving On-Policy Distillation for Agentic Reinforcement Learning","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-02T01:10:21.180101Z"},"links":{"citing_paper":"/paper/2607.14777"},"observation_digest":"sha256:abd98c7b21a624ebb925d22724a6a5bebf20d9d40cdfab0717575686f129c41d","observation_id":"69e6d170-8d97-4f06-88eb-24e6d293c2d4","resolution":{"observed_at":"2026-08-02T01:10:21.180101Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T01:10:21.183105Z","title":"Proceedings of the 2016 Conference on Empirical Methods in Natural Language Processing , pages =","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2607.14777","last_updated":"2026-07-16T09:57:18Z","snapshot_observed_at":"2026-08-20T01:11:29.310491Z","submitted_at":"2026-07-16T09:57:18Z","title":"SEED: Self-Evolving On-Policy Distillation for Agentic Reinforcement Learning","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-02T01:10:21.183105Z"},"links":{"citing_paper":"/paper/2607.14777"},"observation_digest":"sha256:bbfc7cbb35a13ab1065894a4a1ead4d1c96612c9b3721fd404f69b517c1dd187","observation_id":"cfe4140c-27ae-42bc-a343-271b2e3f906a","resolution":{"observed_at":"2026-08-02T01:10:21.183105Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T01:10:21.185956Z","title":"Proceedings of the Fourteenth International Conference on Artificial Intelligence and Statistics , pages =","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2607.14777","last_updated":"2026-07-16T09:57:18Z","snapshot_observed_at":"2026-08-20T01:11:29.310491Z","submitted_at":"2026-07-16T09:57:18Z","title":"SEED: Self-Evolving On-Policy Distillation for Agentic Reinforcement Learning","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-02T01:10:21.185956Z"},"links":{"citing_paper":"/paper/2607.14777"},"observation_digest":"sha256:dd0821c297df820bed451db9aefe9377d9e728f4bc85f44556dbd10c0177db9e","observation_id":"2bab3260-8058-4a74-93df-f92f9a125470","resolution":{"observed_at":"2026-08-02T01:10:21.185956Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T01:10:21.189027Z","title":"International Conference on Learning Representations , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.14777","last_updated":"2026-07-16T09:57:18Z","snapshot_observed_at":"2026-08-20T01:11:29.310491Z","submitted_at":"2026-07-16T09:57:18Z","title":"SEED: Self-Evolving On-Policy Distillation for Agentic Reinforcement Learning","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-02T01:10:21.189027Z"},"links":{"citing_paper":"/paper/2607.14777"},"observation_digest":"sha256:b224b7dab2c8d08edd1dce33881ddb3429f34f52b181b4a5637ec0f7d6fb5f6d","observation_id":"c2aead90-2999-4aa2-9e5e-eb91185f490f","resolution":{"observed_at":"2026-08-02T01:10:21.189027Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T01:10:21.192232Z","title":"2026 , eprint =","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.14777","last_updated":"2026-07-16T09:57:18Z","snapshot_observed_at":"2026-08-20T01:11:29.310491Z","submitted_at":"2026-07-16T09:57:18Z","title":"SEED: Self-Evolving On-Policy Distillation for Agentic Reinforcement Learning","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-02T01:10:21.192232Z"},"links":{"citing_paper":"/paper/2607.14777"},"observation_digest":"sha256:0e77d9fd8d2a80dc1f706b877e831ef043666edadb8d925f272c6a330324c9dc","observation_id":"1cc2aa2a-f8fb-40d1-a797-9df933f390df","resolution":{"observed_at":"2026-08-02T01:10:21.192232Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T01:10:21.195171Z","title":"2026 , eprint =","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.14777","last_updated":"2026-07-16T09:57:18Z","snapshot_observed_at":"2026-08-20T01:11:29.310491Z","submitted_at":"2026-07-16T09:57:18Z","title":"SEED: Self-Evolving On-Policy Distillation for Agentic Reinforcement Learning","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-02T01:10:21.195171Z"},"links":{"citing_paper":"/paper/2607.14777"},"observation_digest":"sha256:981195ddc9e15daf48c3e647a7dc1082fa99a7d0902195c5227848c2e1707fb8","observation_id":"4343d417-ab8b-42df-bab0-c1bf13219df7","resolution":{"observed_at":"2026-08-02T01:10:21.195171Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.10674","last_updated":"2026-04-12T14:57:52Z","snapshot_observed_at":"2026-08-18T16:44:14.964518Z","submitted_at":"2026-04-12T14:57:52Z","title":"Skill-SD: Skill-Conditioned Self-Distillation for Multi-turn LLM Agents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.10674","snapshot_observed_at":"2026-08-02T01:10:21.198042Z","title":"2604.10674 , archivePrefix =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.14777","last_updated":"2026-07-16T09:57:18Z","snapshot_observed_at":"2026-08-20T01:11:29.310491Z","submitted_at":"2026-07-16T09:57:18Z","title":"SEED: Self-Evolving On-Policy Distillation for Agentic Reinforcement Learning","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-02T01:10:21.198042Z"},"links":{"cited_paper":"/paper/2604.10674","citing_paper":"/paper/2607.14777"},"observation_digest":"sha256:4941d676f08f95d8b5ed208d369909b6d71396b7bce4de25fbf4dfbef3824a07","observation_id":"b6331b0d-33fa-49ec-ba2d-8e864506e8f9","resolution":{"observed_at":"2026-08-02T01:10:21.198042Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.03128","last_updated":"2026-04-08T08:22:36Z","snapshot_observed_at":"2026-08-03T04:49:13.270533Z","submitted_at":"2026-04-03T15:50:07Z","title":"Self-Distilled RLVR","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.03128","snapshot_observed_at":"2026-08-02T01:10:21.201488Z","title":"Self-Distilled","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.14777","last_updated":"2026-07-16T09:57:18Z","snapshot_observed_at":"2026-08-20T01:11:29.310491Z","submitted_at":"2026-07-16T09:57:18Z","title":"SEED: Self-Evolving On-Policy Distillation for Agentic Reinforcement Learning","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-02T01:10:21.201488Z"},"links":{"cited_paper":"/paper/2604.03128","citing_paper":"/paper/2607.14777"},"observation_digest":"sha256:4c212b1d81f141121367a38521711baa663285399a046ba4f225ef2e72fb7df5","observation_id":"37b037c6-1def-4f23-af13-511901105b87","resolution":{"observed_at":"2026-08-02T01:10:21.201488Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T01:10:21.205005Z","title":"2026 , eprint =","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.14777","last_updated":"2026-07-16T09:57:18Z","snapshot_observed_at":"2026-08-20T01:11:29.310491Z","submitted_at":"2026-07-16T09:57:18Z","title":"SEED: Self-Evolving On-Policy Distillation for Agentic Reinforcement Learning","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-02T01:10:21.205005Z"},"links":{"citing_paper":"/paper/2607.14777"},"observation_digest":"sha256:1631fdbaf47862632dfd120f7a441c46a926766f92efb9b425c7a39ba5657666","observation_id":"7039d7d7-3d0f-41d0-9b33-6e6203180fe0","resolution":{"observed_at":"2026-08-02T01:10:21.205005Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.07725","last_updated":"2026-08-18T09:21:07Z","snapshot_observed_at":"2026-08-20T14:20:23.970285Z","submitted_at":"2026-05-08T13:30:42Z","title":"SOD: Step-wise On-policy Distillation for Small Language Model Agents","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.07725","snapshot_observed_at":"2026-08-02T01:10:21.208505Z","title":"2605.07725 , archivePrefix =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.14777","last_updated":"2026-07-16T09:57:18Z","snapshot_observed_at":"2026-08-20T01:11:29.310491Z","submitted_at":"2026-07-16T09:57:18Z","title":"SEED: Self-Evolving On-Policy Distillation for Agentic Reinforcement Learning","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-02T01:10:21.208505Z"},"links":{"cited_paper":"/paper/2605.07725","citing_paper":"/paper/2607.14777"},"observation_digest":"sha256:eba1e76f0039e9a14469b3bd45192de59c8250c2b3b2c0c82386f4cf4d35d48c","observation_id":"7a314ad0-18a8-488a-b9d8-b62c70a61dbb","resolution":{"observed_at":"2026-08-02T01:10:21.208505Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T01:10:21.211611Z","title":"2026 , eprint =","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.14777","last_updated":"2026-07-16T09:57:18Z","snapshot_observed_at":"2026-08-20T01:11:29.310491Z","submitted_at":"2026-07-16T09:57:18Z","title":"SEED: Self-Evolving On-Policy Distillation for Agentic Reinforcement Learning","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-02T01:10:21.211611Z"},"links":{"citing_paper":"/paper/2607.14777"},"observation_digest":"sha256:74717f0415ffee329354626ba947af9a01b361c7588c70e1626e7842180f11eb","observation_id":"c7b042b2-5b7a-49ce-8015-990f5969e8e7","resolution":{"observed_at":"2026-08-02T01:10:21.211611Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2606.26790","last_updated":"2026-06-25T09:24:09Z","snapshot_observed_at":"2026-08-13T16:34:23.083434Z","submitted_at":"2026-06-25T09:24:09Z","title":"OPID: On-Policy Skill Distillation for Agentic Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2606.26790","snapshot_observed_at":"2026-08-02T01:10:21.214520Z","title":"arXiv preprint arXiv:2606.26790 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.14777","last_updated":"2026-07-16T09:57:18Z","snapshot_observed_at":"2026-08-20T01:11:29.310491Z","submitted_at":"2026-07-16T09:57:18Z","title":"SEED: Self-Evolving On-Policy Distillation for Agentic Reinforcement Learning","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-02T01:10:21.214520Z"},"links":{"cited_paper":"/paper/2606.26790","citing_paper":"/paper/2607.14777"},"observation_digest":"sha256:2216e0ec2d71685e0e941827af15a6b0e016c29bd6ffe40c03fcaa4a0b6be375","observation_id":"bf122c46-a460-450d-bb6d-3e530775a299","resolution":{"observed_at":"2026-08-02T01:10:21.214520Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.18478","last_updated":"2025-06-02T14:26:19Z","snapshot_observed_at":"2026-08-20T12:40:36.754302Z","submitted_at":"2024-11-27T16:19:00Z","title":"Beyond Examples: High-level Automated Reasoning Paradigm in In-Context Learning via MCTS","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.18478","snapshot_observed_at":"2026-08-02T01:10:21.218621Z","title":"arXiv preprint arXiv:2411.18478 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.14777","last_updated":"2026-07-16T09:57:18Z","snapshot_observed_at":"2026-08-20T01:11:29.310491Z","submitted_at":"2026-07-16T09:57:18Z","title":"SEED: Self-Evolving On-Policy Distillation for Agentic Reinforcement Learning","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-02T01:10:21.218621Z"},"links":{"cited_paper":"/paper/2411.18478","citing_paper":"/paper/2607.14777"},"observation_digest":"sha256:8c9a3a5dfcab99129403c8789d6b8ef87060c87ca94f941f53945aa23c725dc9","observation_id":"c6532049-0386-47a5-b6be-eece2ac59a81","resolution":{"observed_at":"2026-08-02T01:10:21.218621Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.22177","last_updated":"2026-05-21T08:47:49Z","snapshot_observed_at":"2026-08-17T12:35:36.207721Z","submitted_at":"2026-05-21T08:47:49Z","title":"Maestro: Reinforcement Learning to Orchestrate Hierarchical Model-Skill Ensembles","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.22177","snapshot_observed_at":"2026-08-02T01:10:21.221920Z","title":"arXiv preprint arXiv:2605.22177 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.14777","last_updated":"2026-07-16T09:57:18Z","snapshot_observed_at":"2026-08-20T01:11:29.310491Z","submitted_at":"2026-07-16T09:57:18Z","title":"SEED: Self-Evolving On-Policy Distillation for Agentic Reinforcement Learning","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-02T01:10:21.221920Z"},"links":{"cited_paper":"/paper/2605.22177","citing_paper":"/paper/2607.14777"},"observation_digest":"sha256:274c5b0045a0986e86c9e7f72a2d21a1b4f7ffa0b8e4dbdea8d35213a68c9b9e","observation_id":"27cdb7a9-3d91-4010-90bd-d8a0171ee47d","resolution":{"observed_at":"2026-08-02T01:10:21.221920Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T01:10:21.226030Z","title":"Advances in neural information processing systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.14777","last_updated":"2026-07-16T09:57:18Z","snapshot_observed_at":"2026-08-20T01:11:29.310491Z","submitted_at":"2026-07-16T09:57:18Z","title":"SEED: Self-Evolving On-Policy Distillation for Agentic Reinforcement Learning","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-02T01:10:21.226030Z"},"links":{"citing_paper":"/paper/2607.14777"},"observation_digest":"sha256:be8542d113891222c976e6b0d0b7bfd258b7296a0f13a83817b8eef929009e8d","observation_id":"d5d9fd56-88e4-4bad-a658-4d40cc437e50","resolution":{"observed_at":"2026-08-02T01:10:21.226030Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T01:10:21.229971Z","title":"Double: Breaking the Acceleration Limit via Double Retrieval Speculative Parallelism","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.14777","last_updated":"2026-07-16T09:57:18Z","snapshot_observed_at":"2026-08-20T01:11:29.310491Z","submitted_at":"2026-07-16T09:57:18Z","title":"SEED: Self-Evolving On-Policy Distillation for Agentic Reinforcement Learning","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-02T01:10:21.229971Z"},"links":{"citing_paper":"/paper/2607.14777"},"observation_digest":"sha256:8eaa0b60435a5b078f0465f6d1714717c5eac824dd55c840b7b6d41a6621c725","observation_id":"735c0b4b-579e-4418-be6a-02ab0827423d","resolution":{"observed_at":"2026-08-02T01:10:21.229971Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.21460","last_updated":"2025-03-27T12:50:17Z","snapshot_observed_at":"2026-07-06T20:59:35.694800Z","submitted_at":"2025-03-27T12:50:17Z","title":"Large Language Model Agent: A Survey on Methodology, Applications and Challenges","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.21460","snapshot_observed_at":"2026-08-02T01:10:21.233653Z","title":"arXiv preprint arXiv:2503.21460 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.14777","last_updated":"2026-07-16T09:57:18Z","snapshot_observed_at":"2026-08-20T01:11:29.310491Z","submitted_at":"2026-07-16T09:57:18Z","title":"SEED: Self-Evolving On-Policy Distillation for Agentic Reinforcement Learning","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-02T01:10:21.233653Z"},"links":{"cited_paper":"/paper/2503.21460","citing_paper":"/paper/2607.14777"},"observation_digest":"sha256:d7ae4302cbd4bd3cc963a96b714826fd4d60332359eedf048216fb55073dc815","observation_id":"ae2fdea5-7636-4866-84c8-4c760c4c676c","resolution":{"observed_at":"2026-08-02T01:10:21.233653Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.06234","last_updated":"2026-06-09T07:34:06Z","snapshot_observed_at":"2026-08-17T02:59:06.136139Z","submitted_at":"2026-05-07T13:22:26Z","title":"RobotEQ: Transitioning from Passive Intelligence to Active Intelligence in Embodied AI","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.06234","snapshot_observed_at":"2026-08-02T01:10:21.236755Z","title":"arXiv preprint arXiv:2605.06234 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.14777","last_updated":"2026-07-16T09:57:18Z","snapshot_observed_at":"2026-08-20T01:11:29.310491Z","submitted_at":"2026-07-16T09:57:18Z","title":"SEED: Self-Evolving On-Policy Distillation for Agentic Reinforcement Learning","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-02T01:10:21.236755Z"},"links":{"cited_paper":"/paper/2605.06234","citing_paper":"/paper/2607.14777"},"observation_digest":"sha256:5c7f128bf451f34b9706b615969e391e97f5fdda178c01e867111dade5323c2d","observation_id":"4bffe0ec-6079-4833-881a-2253446f9b02","resolution":{"observed_at":"2026-08-02T01:10:21.236755Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T01:10:21.240246Z","title":"SPARK : Strategic Policy-Aware Exploration via Dynamic Branching for Long-Horizon Agentic Learning","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.14777","last_updated":"2026-07-16T09:57:18Z","snapshot_observed_at":"2026-08-20T01:11:29.310491Z","submitted_at":"2026-07-16T09:57:18Z","title":"SEED: Self-Evolving On-Policy Distillation for Agentic Reinforcement Learning","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-02T01:10:21.240246Z"},"links":{"citing_paper":"/paper/2607.14777"},"observation_digest":"sha256:c837d68652c7d06ffea611994962a5c141895cfb6ce7cded2d97881f34639d66","observation_id":"ea0eca4e-ef45-4e0c-b91f-86b8bb820826","resolution":{"observed_at":"2026-08-02T01:10:21.240246Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2602.05843","last_updated":"2026-06-04T17:59:52Z","snapshot_observed_at":"2026-08-18T18:45:27.055937Z","submitted_at":"2026-02-05T16:31:43Z","title":"OdysseyArena: Benchmarking Large Language Models For Long-Horizon, Active and Inductive Interactions","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2602.05843","snapshot_observed_at":"2026-08-02T01:10:21.243699Z","title":"arXiv preprint arXiv:2602.05843 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.14777","last_updated":"2026-07-16T09:57:18Z","snapshot_observed_at":"2026-08-20T01:11:29.310491Z","submitted_at":"2026-07-16T09:57:18Z","title":"SEED: Self-Evolving On-Policy Distillation for Agentic Reinforcement Learning","version":1},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-02T01:10:21.243699Z"},"links":{"cited_paper":"/paper/2602.05843","citing_paper":"/paper/2607.14777"},"observation_digest":"sha256:2a7da5ab1bfedf31e136bb1cb0500b5851d921d18e8e0ad287cc26af3c76fe5e","observation_id":"af3179df-4eb4-4276-ac8f-2bcd261284e6","resolution":{"observed_at":"2026-08-02T01:10:21.243699Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2607.05147","last_updated":"2026-07-06T14:28:06Z","snapshot_observed_at":"2026-08-16T18:18:08.249251Z","submitted_at":"2026-07-06T14:28:06Z","title":"DSpark: Confidence-Scheduled Speculative Decoding with Semi-Autoregressive Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2607.05147","snapshot_observed_at":"2026-08-02T01:10:21.247710Z","title":"arXiv preprint arXiv:2607.05147 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.14777","last_updated":"2026-07-16T09:57:18Z","snapshot_observed_at":"2026-08-20T01:11:29.310491Z","submitted_at":"2026-07-16T09:57:18Z","title":"SEED: Self-Evolving On-Policy Distillation for Agentic Reinforcement Learning","version":1},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-02T01:10:21.247710Z"},"links":{"cited_paper":"/paper/2607.05147","citing_paper":"/paper/2607.14777"},"observation_digest":"sha256:78c90b5a790ac1ddfe4c0c5d1d9f0870d3545549ede0bbe63b36935bbfad45bd","observation_id":"ad8dcda3-0ce8-4684-ba55-2e60184c5923","resolution":{"observed_at":"2026-08-02T01:10:21.247710Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T01:10:21.251713Z","title":"ATLAS : Orchestrating Heterogeneous Models and Tools for Multi-Domain Complex Reasoning","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.14777","last_updated":"2026-07-16T09:57:18Z","snapshot_observed_at":"2026-08-20T01:11:29.310491Z","submitted_at":"2026-07-16T09:57:18Z","title":"SEED: Self-Evolving On-Policy Distillation for Agentic Reinforcement Learning","version":1},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-02T01:10:21.251713Z"},"links":{"citing_paper":"/paper/2607.14777"},"observation_digest":"sha256:ccafb27458717dff1c04272d9a9966ee8a45f07e8697d198a187dfd237a5fd32","observation_id":"9639b6e7-7ac7-43e9-b175-c810cb57eae4","resolution":{"observed_at":"2026-08-02T01:10:21.251713Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T01:10:21.255768Z","title":"2026 , eprint=","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.14777","last_updated":"2026-07-16T09:57:18Z","snapshot_observed_at":"2026-08-20T01:11:29.310491Z","submitted_at":"2026-07-16T09:57:18Z","title":"SEED: Self-Evolving On-Policy Distillation for Agentic Reinforcement Learning","version":1},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-02T01:10:21.255768Z"},"links":{"citing_paper":"/paper/2607.14777"},"observation_digest":"sha256:819a8dc2d31c1e8fb674de54827fcd8eb8dc0655acc4a765042b5e439e336dd2","observation_id":"ef6b86e6-db06-4c4f-900e-fbc8d55f6594","resolution":{"observed_at":"2026-08-02T01:10:21.255768Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T01:10:21.259062Z","title":"arXiv preprint arXiv:2601.18137 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.14777","last_updated":"2026-07-16T09:57:18Z","snapshot_observed_at":"2026-08-20T01:11:29.310491Z","submitted_at":"2026-07-16T09:57:18Z","title":"SEED: Self-Evolving On-Policy Distillation for Agentic Reinforcement Learning","version":1},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-02T01:10:21.259062Z"},"links":{"citing_paper":"/paper/2607.14777"},"observation_digest":"sha256:0ee2d4183dce5d240367a663b24d69424aca7c0837e5d196ca8240ad3aa3c52a","observation_id":"35a0467d-beb6-4029-969f-688446922386","resolution":{"observed_at":"2026-08-02T01:10:21.259062Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.13649","last_updated":"2024-06-06T02:01:09Z","snapshot_observed_at":"2026-08-15T00:56:43.641640Z","submitted_at":"2024-01-24T18:35:21Z","title":"VisualWebArena: Evaluating Multimodal Agents on Realistic Visual Web Tasks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.13649","snapshot_observed_at":"2026-08-02T01:10:21.262611Z","title":"arXiv preprint arXiv:2401.13649 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.14777","last_updated":"2026-07-16T09:57:18Z","snapshot_observed_at":"2026-08-20T01:11:29.310491Z","submitted_at":"2026-07-16T09:57:18Z","title":"SEED: Self-Evolving On-Policy Distillation for Agentic Reinforcement Learning","version":1},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-08-02T01:10:21.262611Z"},"links":{"cited_paper":"/paper/2401.13649","citing_paper":"/paper/2607.14777"},"observation_digest":"sha256:cf9fc91480f8b90de0bb3e4cc8be7aaaabee2d46a56acc8b3c1e3d0042e06508","observation_id":"84746ed0-21e8-473f-a199-62eb1b6413ca","resolution":{"observed_at":"2026-08-02T01:10:21.262611Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.02268","last_updated":"2026-05-15T09:15:24Z","snapshot_observed_at":"2026-08-15T02:06:36.215734Z","submitted_at":"2026-04-02T17:03:05Z","title":"SKILL0: In-Context Agentic Reinforcement Learning for Skill Internalization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.02268","snapshot_observed_at":"2026-08-02T01:10:21.265931Z","title":"arXiv preprint arXiv:2604.02268 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.14777","last_updated":"2026-07-16T09:57:18Z","snapshot_observed_at":"2026-08-20T01:11:29.310491Z","submitted_at":"2026-07-16T09:57:18Z","title":"SEED: Self-Evolving On-Policy Distillation for Agentic Reinforcement Learning","version":1},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-08-02T01:10:21.265931Z"},"links":{"cited_paper":"/paper/2604.02268","citing_paper":"/paper/2607.14777"},"observation_digest":"sha256:48987adba4cb37e42803f91eabef86fc81ad2b48b5f63b7ddcf6298123f5020c","observation_id":"592a29e5-73d6-4c40-a5c4-d799c0ae4241","resolution":{"observed_at":"2026-08-02T01:10:21.265931Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-08-17T18:50:07.059564Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15115","snapshot_observed_at":"2026-08-02T01:10:21.268893Z","title":"arXiv preprint arXiv:2412.15115 , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.14777","last_updated":"2026-07-16T09:57:18Z","snapshot_observed_at":"2026-08-20T01:11:29.310491Z","submitted_at":"2026-07-16T09:57:18Z","title":"SEED: Self-Evolving On-Policy Distillation for Agentic Reinforcement Learning","version":1},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-08-02T01:10:21.268893Z"},"links":{"cited_paper":"/paper/2412.15115","citing_paper":"/paper/2607.14777"},"observation_digest":"sha256:22433fba576fcf1ec54008aa752c7f8ace4e74377e1cd26b56675707c59763fa","observation_id":"e75e843f-7333-4a22-a0dc-f831cc737ecb","resolution":{"observed_at":"2026-08-02T01:10:21.268893Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-08-02T01:10:21.272008Z","title":"arXiv preprint arXiv:2505.09388 , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.14777","last_updated":"2026-07-16T09:57:18Z","snapshot_observed_at":"2026-08-20T01:11:29.310491Z","submitted_at":"2026-07-16T09:57:18Z","title":"SEED: Self-Evolving On-Policy Distillation for Agentic Reinforcement Learning","version":1},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-08-02T01:10:21.272008Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2607.14777"},"observation_digest":"sha256:98893341331fe402642b5bbd2f2e954c3afe22fb440fcc7c18381aa6d9c4d131","observation_id":"6ad18bb9-7b1f-4b0f-a28f-e6014469903d","resolution":{"observed_at":"2026-08-02T01:10:21.272008Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-08-14T04:17:22.593941Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-02T01:10:21.275184Z","title":"5-vl technical report , author=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.14777","last_updated":"2026-07-16T09:57:18Z","snapshot_observed_at":"2026-08-20T01:11:29.310491Z","submitted_at":"2026-07-16T09:57:18Z","title":"SEED: Self-Evolving On-Policy Distillation for Agentic Reinforcement Learning","version":1},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-08-02T01:10:21.275184Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2607.14777"},"observation_digest":"sha256:9b73f0c6b5007f6df8bd1cd138eb4f98933f63150b583d1befa3b5bdbfd707d3","observation_id":"f0432ea4-cd50-4567-9c96-6c3044859257","resolution":{"observed_at":"2026-08-02T01:10:21.275184Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T01:10:21.279131Z","title":"Fine-Tuning Large Vision-Language Models as Decision-Making Agents via Reinforcement Learning , url =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.14777","last_updated":"2026-07-16T09:57:18Z","snapshot_observed_at":"2026-08-20T01:11:29.310491Z","submitted_at":"2026-07-16T09:57:18Z","title":"SEED: Self-Evolving On-Policy Distillation for Agentic Reinforcement Learning","version":1},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-08-02T01:10:21.279131Z"},"links":{"citing_paper":"/paper/2607.14777"},"observation_digest":"sha256:65030a70a8dc9e25fc4304724267dfc831f4a56adda9840af3f50a96bcb7f1ed","observation_id":"4e0c3948-de58-4b2e-871b-193bf04ddd72","resolution":{"observed_at":"2026-08-02T01:10:21.279131Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T01:10:21.282994Z","title":", title =","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.14777","last_updated":"2026-07-16T09:57:18Z","snapshot_observed_at":"2026-08-20T01:11:29.310491Z","submitted_at":"2026-07-16T09:57:18Z","title":"SEED: Self-Evolving On-Policy Distillation for Agentic Reinforcement Learning","version":1},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-08-02T01:10:21.282994Z"},"links":{"citing_paper":"/paper/2607.14777"},"observation_digest":"sha256:c9a0c859da9be1f76f7257061d6380c5e3f362726ea52ab1d6a683c3bbb55dc1","observation_id":"6bb645eb-5377-4df9-9c3f-228674e0260e","resolution":{"observed_at":"2026-08-02T01:10:21.282994Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T01:10:21.285839Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.14777","last_updated":"2026-07-16T09:57:18Z","snapshot_observed_at":"2026-08-20T01:11:29.310491Z","submitted_at":"2026-07-16T09:57:18Z","title":"SEED: Self-Evolving On-Policy Distillation for Agentic Reinforcement Learning","version":1},"reference_index":67,"source":"arxiv_source","source_observed_at":"2026-08-02T01:10:21.285839Z"},"links":{"citing_paper":"/paper/2607.14777"},"observation_digest":"sha256:b1e516345a627b89c00d594bd3ae4ec58a70e6be2a7c7eebe0f59f40cdb4ee05","observation_id":"83b1f7b7-314b-44b2-9291-4dc98d2fdcae","resolution":{"observed_at":"2026-08-02T01:10:21.285839Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T01:10:21.289491Z","title":"Proceedings of the AAAI Conference on Artificial Intelligence , volume=","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.14777","last_updated":"2026-07-16T09:57:18Z","snapshot_observed_at":"2026-08-20T01:11:29.310491Z","submitted_at":"2026-07-16T09:57:18Z","title":"SEED: Self-Evolving On-Policy Distillation for Agentic Reinforcement Learning","version":1},"reference_index":68,"source":"arxiv_source","source_observed_at":"2026-08-02T01:10:21.289491Z"},"links":{"citing_paper":"/paper/2607.14777"},"observation_digest":"sha256:5cc3aa97261410a301e5de9e22b05dcf3d69f2f3c9658e402c7256006c0818f8","observation_id":"8f44b57f-241f-41ad-897d-649b179f1636","resolution":{"observed_at":"2026-08-02T01:10:21.289491Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T01:10:21.292396Z","title":"Forty-third International Conference on Machine Learning , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.14777","last_updated":"2026-07-16T09:57:18Z","snapshot_observed_at":"2026-08-20T01:11:29.310491Z","submitted_at":"2026-07-16T09:57:18Z","title":"SEED: Self-Evolving On-Policy Distillation for Agentic Reinforcement Learning","version":1},"reference_index":69,"source":"arxiv_source","source_observed_at":"2026-08-02T01:10:21.292396Z"},"links":{"citing_paper":"/paper/2607.14777"},"observation_digest":"sha256:032ddd2a0abd882da02e14279ec6bb3f618174b6f8231d0fb85329bfc22e6f37","observation_id":"a1e6bcff-1dcd-412e-b21a-1df5ac5fae9a","resolution":{"observed_at":"2026-08-02T01:10:21.292396Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T01:10:21.296070Z","title":"Proceedings of the AAAI Conference on Artificial Intelligence , volume=","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.14777","last_updated":"2026-07-16T09:57:18Z","snapshot_observed_at":"2026-08-20T01:11:29.310491Z","submitted_at":"2026-07-16T09:57:18Z","title":"SEED: Self-Evolving On-Policy Distillation for Agentic Reinforcement Learning","version":1},"reference_index":70,"source":"arxiv_source","source_observed_at":"2026-08-02T01:10:21.296070Z"},"links":{"citing_paper":"/paper/2607.14777"},"observation_digest":"sha256:12f1220bc6b6af6fea7cf657e34f0e0fd929692553f370e05518518d040fd615","observation_id":"ff752704-dcd9-4159-8923-4750dd7bee3d","resolution":{"observed_at":"2026-08-02T01:10:21.296070Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T01:10:21.299566Z","title":"International Conference on Learning Representations , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.14777","last_updated":"2026-07-16T09:57:18Z","snapshot_observed_at":"2026-08-20T01:11:29.310491Z","submitted_at":"2026-07-16T09:57:18Z","title":"SEED: Self-Evolving On-Policy Distillation for Agentic Reinforcement Learning","version":1},"reference_index":71,"source":"arxiv_source","source_observed_at":"2026-08-02T01:10:21.299566Z"},"links":{"citing_paper":"/paper/2607.14777"},"observation_digest":"sha256:7ec4f2e4d9c8200d6592cb577bba17cebf28d77f62f766541c0a746d2ebb3f17","observation_id":"f65b1c8a-57e0-4454-8180-1a46979f5148","resolution":{"observed_at":"2026-08-02T01:10:21.299566Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T01:10:21.302473Z","title":"Proceedings of the AAAI Conference on Artificial Intelligence , volume=","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.14777","last_updated":"2026-07-16T09:57:18Z","snapshot_observed_at":"2026-08-20T01:11:29.310491Z","submitted_at":"2026-07-16T09:57:18Z","title":"SEED: Self-Evolving On-Policy Distillation for Agentic Reinforcement Learning","version":1},"reference_index":72,"source":"arxiv_source","source_observed_at":"2026-08-02T01:10:21.302473Z"},"links":{"citing_paper":"/paper/2607.14777"},"observation_digest":"sha256:6a72e747f465bff23cce8636411594e0829a063c85fb38efd0c69f1577bdd7ca","observation_id":"82147def-5fc7-4604-aecb-5efb3a05916b","resolution":{"observed_at":"2026-08-02T01:10:21.302473Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T01:10:21.305795Z","title":"Proceedings of the AAAI Conference on Artificial Intelligence , volume=","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.14777","last_updated":"2026-07-16T09:57:18Z","snapshot_observed_at":"2026-08-20T01:11:29.310491Z","submitted_at":"2026-07-16T09:57:18Z","title":"SEED: Self-Evolving On-Policy Distillation for Agentic Reinforcement Learning","version":1},"reference_index":73,"source":"arxiv_source","source_observed_at":"2026-08-02T01:10:21.305795Z"},"links":{"citing_paper":"/paper/2607.14777"},"observation_digest":"sha256:2d4abf4d41a04159150ed7568db4e519015d6c0609ce0f89cba86544d24ae862","observation_id":"fd0a1e02-7863-4bd0-aa72-a64d88f4abbf","resolution":{"observed_at":"2026-08-02T01:10:21.305795Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2025.emnlp-main.839","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"2025 , address=","venue":null,"work_id":"af63db9d-f45a-4c32-9202-74978f738ffe","year":2025},"citing_paper":{"arxiv_id":"2607.14777","last_updated":"2026-07-16T09:57:18Z","snapshot_observed_at":"2026-08-20T01:11:29.310491Z","submitted_at":"2026-07-16T09:57:18Z","title":"SEED: Self-Evolving On-Policy Distillation for Agentic Reinforcement Learning","version":1},"reference_index":74,"source":"arxiv_source","source_observed_at":"2026-08-02T01:10:21.309226Z"},"links":{"citing_paper":"/paper/2607.14777"},"observation_digest":"sha256:21d8be169d9b6164541d06f68772574325891f5e23c5a3bdab7ca132302e5314","observation_id":"8aafa1ea-e4aa-4d18-9d27-de137671f082","resolution":{"observed_at":"2026-08-02T01:13:58.398667Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2607.14777","last_updated":"2026-07-16T09:57:18Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-20T01:11:29.310491Z","submitted_at":"2026-07-16T09:57:18Z","title":"SEED: Self-Evolving On-Policy Distillation for Agentic Reinforcement Learning"},"reference_resolution":{"displayed":74,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":73,"verified_exact":1,"verified_fuzzy":0},"total_outbound_references":74},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"thesis":"As of 20 August 2026, this Paper Citation Record lists 74 of 74 outbound references and 5 inbound Pith citation observations for arXiv:2607.14777."}