{"as_of":"2026-08-09T20:14:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:fb1fb300ae451c99a7deef954bafea457d8a4bba394ca7c8a88913316405af00","coverage":[{"denominator":77,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":77,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T19:53:26.173725Z","state":"measured"},{"denominator":77,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":77,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2608.05987/citation-record","integrity":"/paper/2608.05987/integrity","json":"/paper/2608.05987/citation-record.json","paper":"/paper/2608.05987"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T19:53:24.992869Z","title":"2026 , eprint=","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.05987","last_updated":"2026-08-06T13:00:59Z","snapshot_observed_at":"2026-08-09T20:13:11.745301Z","submitted_at":"2026-08-06T13:00:59Z","title":"AgentOPSD: Recursive Self-Distillation for Agentic Reinforcement Learning","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-07T19:53:24.992869Z"},"links":{"citing_paper":"/paper/2608.05987"},"observation_digest":"sha256:1e45afbc066a0937216f9776a35bf340f8d5b633dbccda0c88291d7a62128954","observation_id":"82d516c7-7361-4464-8e74-9c0c1715ae86","resolution":{"observed_at":"2026-08-07T19:53:24.992869Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T19:53:24.998800Z","title":"2026 , eprint=","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.05987","last_updated":"2026-08-06T13:00:59Z","snapshot_observed_at":"2026-08-09T20:13:11.745301Z","submitted_at":"2026-08-06T13:00:59Z","title":"AgentOPSD: Recursive Self-Distillation for Agentic Reinforcement Learning","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-07T19:53:24.998800Z"},"links":{"citing_paper":"/paper/2608.05987"},"observation_digest":"sha256:a2a07694f048800dd8afeb026c28d7d8c0c516c32e06f69524d379920ec9e0df","observation_id":"9b876981-78b5-410b-af7a-3a85d061131b","resolution":{"observed_at":"2026-08-07T19:53:24.998800Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T19:53:25.004243Z","title":"2026 , eprint=","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.05987","last_updated":"2026-08-06T13:00:59Z","snapshot_observed_at":"2026-08-09T20:13:11.745301Z","submitted_at":"2026-08-06T13:00:59Z","title":"AgentOPSD: Recursive Self-Distillation for Agentic Reinforcement Learning","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-07T19:53:25.004243Z"},"links":{"citing_paper":"/paper/2608.05987"},"observation_digest":"sha256:5fe42e1592823fac2ec8941f170020069a4340c0fec343246ad5f8a2c5328cda","observation_id":"942e9632-ec05-48bf-9c02-77f51e92b41e","resolution":{"observed_at":"2026-08-07T19:53:25.004243Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T19:53:25.009238Z","title":"2026 , eprint=","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.05987","last_updated":"2026-08-06T13:00:59Z","snapshot_observed_at":"2026-08-09T20:13:11.745301Z","submitted_at":"2026-08-06T13:00:59Z","title":"AgentOPSD: Recursive Self-Distillation for Agentic Reinforcement Learning","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-07T19:53:25.009238Z"},"links":{"citing_paper":"/paper/2608.05987"},"observation_digest":"sha256:b68a4c7ab054dc6b80897a79285aa670bdb039ef579db18d7e841e2db1809041","observation_id":"39cb9bad-9b74-4640-8722-3fa2f343bdf6","resolution":{"observed_at":"2026-08-07T19:53:25.009238Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T19:53:25.034126Z","title":"2026 , eprint=","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.05987","last_updated":"2026-08-06T13:00:59Z","snapshot_observed_at":"2026-08-09T20:13:11.745301Z","submitted_at":"2026-08-06T13:00:59Z","title":"AgentOPSD: Recursive Self-Distillation for Agentic Reinforcement Learning","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-07T19:53:25.034126Z"},"links":{"citing_paper":"/paper/2608.05987"},"observation_digest":"sha256:3fab943363dc59f20fcb282be3f547c9a7ec9f161e3b4f61138fe98c63fc097a","observation_id":"667a98ec-614e-47d4-8999-26fb44de5b99","resolution":{"observed_at":"2026-08-07T19:53:25.034126Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T19:53:29.108382Z","title":"2026 , eprint=","venue":null,"work_id":"d8661418-a1f0-4634-87ec-886ee1538790","year":2026},"citing_paper":{"arxiv_id":"2608.05987","last_updated":"2026-08-06T13:00:59Z","snapshot_observed_at":"2026-08-09T20:13:11.745301Z","submitted_at":"2026-08-06T13:00:59Z","title":"AgentOPSD: Recursive Self-Distillation for Agentic Reinforcement Learning","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-07T19:53:25.085810Z"},"links":{"citing_paper":"/paper/2608.05987"},"observation_digest":"sha256:489c17c5b6870f1f264ccca172848d9a5e69096c6c43f62c06e8c4d0f65836ca","observation_id":"7d3d36e5-cd90-433b-bacb-6f821ec383a5","resolution":{"observed_at":"2026-08-07T19:53:29.145173Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T19:53:25.115986Z","title":"2026 , eprint=","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.05987","last_updated":"2026-08-06T13:00:59Z","snapshot_observed_at":"2026-08-09T20:13:11.745301Z","submitted_at":"2026-08-06T13:00:59Z","title":"AgentOPSD: Recursive Self-Distillation for Agentic Reinforcement Learning","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-07T19:53:25.115986Z"},"links":{"citing_paper":"/paper/2608.05987"},"observation_digest":"sha256:f36c98ba8722abb4714072342a678a5d67212699829441f785d61ea56187a8ca","observation_id":"38f9310c-887e-4e49-82dc-a9f20ac46ec1","resolution":{"observed_at":"2026-08-07T19:53:25.115986Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T19:53:25.149185Z","title":"2026 , eprint=","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.05987","last_updated":"2026-08-06T13:00:59Z","snapshot_observed_at":"2026-08-09T20:13:11.745301Z","submitted_at":"2026-08-06T13:00:59Z","title":"AgentOPSD: Recursive Self-Distillation for Agentic Reinforcement Learning","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-07T19:53:25.149185Z"},"links":{"citing_paper":"/paper/2608.05987"},"observation_digest":"sha256:1fc19357f0a9da34cec19637bf303d9fa75c4024e21c92a19e21e2c78cd41466","observation_id":"e7c5d4b0-11bd-4d90-8efc-386bb35b325f","resolution":{"observed_at":"2026-08-07T19:53:25.149185Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T19:53:25.176942Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05987","last_updated":"2026-08-06T13:00:59Z","snapshot_observed_at":"2026-08-09T20:13:11.745301Z","submitted_at":"2026-08-06T13:00:59Z","title":"AgentOPSD: Recursive Self-Distillation for Agentic Reinforcement Learning","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-07T19:53:25.176942Z"},"links":{"citing_paper":"/paper/2608.05987"},"observation_digest":"sha256:7f80edfc0f17e824ce588e7ebdc7692ec69b43ddb0eb914842144ea498c2f02c","observation_id":"b38d946d-e347-49ed-9f92-f7c6a045cff9","resolution":{"observed_at":"2026-08-07T19:53:25.176942Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T19:53:25.189302Z","title":"The eleventh international conference on learning representations , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05987","last_updated":"2026-08-06T13:00:59Z","snapshot_observed_at":"2026-08-09T20:13:11.745301Z","submitted_at":"2026-08-06T13:00:59Z","title":"AgentOPSD: Recursive Self-Distillation for Agentic Reinforcement Learning","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-07T19:53:25.189302Z"},"links":{"citing_paper":"/paper/2608.05987"},"observation_digest":"sha256:1871ab483471d82058cc88d920fbdb75b3afa3e020d0f540aa36a2da7db36ba2","observation_id":"f6aa2346-0797-4f1c-b7eb-0d3b0690e0f3","resolution":{"observed_at":"2026-08-07T19:53:25.189302Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.03768","last_updated":"2021-03-14T22:44:38Z","snapshot_observed_at":"2026-08-08T17:40:47.037804Z","submitted_at":"2020-10-08T05:13:36Z","title":"ALFWorld: Aligning Text and Embodied Environments for Interactive Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.03768","snapshot_observed_at":"2026-08-07T19:53:25.218055Z","title":"arXiv preprint arXiv:2010.03768 , year=","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2608.05987","last_updated":"2026-08-06T13:00:59Z","snapshot_observed_at":"2026-08-09T20:13:11.745301Z","submitted_at":"2026-08-06T13:00:59Z","title":"AgentOPSD: Recursive Self-Distillation for Agentic Reinforcement Learning","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-07T19:53:25.218055Z"},"links":{"cited_paper":"/paper/2010.03768","citing_paper":"/paper/2608.05987"},"observation_digest":"sha256:c6d4f7be325a82a75a091bb5c4ddfbaed6dc103924983e9a47d7450ffa406f45","observation_id":"46fbc3ad-f81c-4ce0-a59e-7e629cc2bcbf","resolution":{"observed_at":"2026-08-07T19:53:25.218055Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.09516","last_updated":"2025-08-05T19:08:38Z","snapshot_observed_at":"2026-07-06T20:51:28.022519Z","submitted_at":"2025-03-12T16:26:39Z","title":"Search-R1: Training LLMs to Reason and Leverage Search Engines with Reinforcement Learning","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.09516","snapshot_observed_at":"2026-08-07T19:53:25.273982Z","title":"arXiv preprint arXiv:2503.09516 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05987","last_updated":"2026-08-06T13:00:59Z","snapshot_observed_at":"2026-08-09T20:13:11.745301Z","submitted_at":"2026-08-06T13:00:59Z","title":"AgentOPSD: Recursive Self-Distillation for Agentic Reinforcement Learning","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-07T19:53:25.273982Z"},"links":{"cited_paper":"/paper/2503.09516","citing_paper":"/paper/2608.05987"},"observation_digest":"sha256:6296cacc28e6a17a14df3f87ccf378013904f761244acaa31f4cba7344a60967","observation_id":"93c6b923-0541-4cbf-8dfc-cf2d80c5f27a","resolution":{"observed_at":"2026-08-07T19:53:25.273982Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T19:53:25.325014Z","title":"Transactions of the Association for Computational Linguistics , volume=","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2608.05987","last_updated":"2026-08-06T13:00:59Z","snapshot_observed_at":"2026-08-09T20:13:11.745301Z","submitted_at":"2026-08-06T13:00:59Z","title":"AgentOPSD: Recursive Self-Distillation for Agentic Reinforcement Learning","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-07T19:53:25.325014Z"},"links":{"citing_paper":"/paper/2608.05987"},"observation_digest":"sha256:3e1a5c4dade1168d86ecccb1763f93d45c55471f8c1958d2adf3f3604e7f9bac","observation_id":"80ccb4e7-5879-4ca6-8af8-86c1b2414914","resolution":{"observed_at":"2026-08-07T19:53:25.325014Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T19:53:25.341911Z","title":"Proceedings of the 55th Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers) , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05987","last_updated":"2026-08-06T13:00:59Z","snapshot_observed_at":"2026-08-09T20:13:11.745301Z","submitted_at":"2026-08-06T13:00:59Z","title":"AgentOPSD: Recursive Self-Distillation for Agentic Reinforcement Learning","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-07T19:53:25.341911Z"},"links":{"citing_paper":"/paper/2608.05987"},"observation_digest":"sha256:f1782f23cc16b327c99cc598bfe37c055d760ae00e96cbe3e821f4676eae18bf","observation_id":"05607002-a70e-44f7-bb3e-313b32897772","resolution":{"observed_at":"2026-08-07T19:53:25.341911Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T19:53:25.354446Z","title":"Proceedings of the 61st annual meeting of the association for computational linguistics (volume 1: Long papers) , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05987","last_updated":"2026-08-06T13:00:59Z","snapshot_observed_at":"2026-08-09T20:13:11.745301Z","submitted_at":"2026-08-06T13:00:59Z","title":"AgentOPSD: Recursive Self-Distillation for Agentic Reinforcement Learning","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-07T19:53:25.354446Z"},"links":{"citing_paper":"/paper/2608.05987"},"observation_digest":"sha256:7ebad178a8445db2c90138e03e55e2324944e399495d5ef81a7a997707213182","observation_id":"9f802145-6ca0-4ede-bc71-aefee01ef16d","resolution":{"observed_at":"2026-08-07T19:53:25.354446Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T19:53:25.360089Z","title":"Proceedings of the 2018 conference on empirical methods in natural language processing , pages=","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2608.05987","last_updated":"2026-08-06T13:00:59Z","snapshot_observed_at":"2026-08-09T20:13:11.745301Z","submitted_at":"2026-08-06T13:00:59Z","title":"AgentOPSD: Recursive Self-Distillation for Agentic Reinforcement Learning","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-07T19:53:25.360089Z"},"links":{"citing_paper":"/paper/2608.05987"},"observation_digest":"sha256:fa4969553825c8c9499506d25a5237e4e518f549c4d0da709fe72cf69f8e509c","observation_id":"baa8d1cd-9425-4610-b82a-e6bbd84bca61","resolution":{"observed_at":"2026-08-07T19:53:25.360089Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T19:53:25.366573Z","title":"Proceedings of the 28th International Conference on Computational Linguistics , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05987","last_updated":"2026-08-06T13:00:59Z","snapshot_observed_at":"2026-08-09T20:13:11.745301Z","submitted_at":"2026-08-06T13:00:59Z","title":"AgentOPSD: Recursive Self-Distillation for Agentic Reinforcement Learning","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-07T19:53:25.366573Z"},"links":{"citing_paper":"/paper/2608.05987"},"observation_digest":"sha256:f49eaaae9c17c9b955abbd0547d3bd977dbdb81450427eb3025f212bfc19fb4a","observation_id":"e5af50b8-21fb-4128-b71b-c30f7aa8743c","resolution":{"observed_at":"2026-08-07T19:53:25.366573Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T19:53:25.376814Z","title":"Transactions of the Association for Computational Linguistics , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05987","last_updated":"2026-08-06T13:00:59Z","snapshot_observed_at":"2026-08-09T20:13:11.745301Z","submitted_at":"2026-08-06T13:00:59Z","title":"AgentOPSD: Recursive Self-Distillation for Agentic Reinforcement Learning","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-07T19:53:25.376814Z"},"links":{"citing_paper":"/paper/2608.05987"},"observation_digest":"sha256:b0aebd193a0e580107a38ec4f6529c9ce86577a543e978e414a806d1ed1bf326","observation_id":"38266335-f39a-499d-9c1c-93407a11ae7a","resolution":{"observed_at":"2026-08-07T19:53:25.376814Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T19:53:25.391568Z","title":"Findings of the Association for Computational Linguistics: EMNLP 2023 , pages=","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.05987","last_updated":"2026-08-06T13:00:59Z","snapshot_observed_at":"2026-08-09T20:13:11.745301Z","submitted_at":"2026-08-06T13:00:59Z","title":"AgentOPSD: Recursive Self-Distillation for Agentic Reinforcement Learning","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-07T19:53:25.391568Z"},"links":{"citing_paper":"/paper/2608.05987"},"observation_digest":"sha256:a995818add8424ca2b1ddd9e0e658a8b40628e0db272fd6196f9e8c0e0244269","observation_id":"47c397c8-2827-4ea1-97a6-b37411405097","resolution":{"observed_at":"2026-08-07T19:53:25.391568Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.10978","last_updated":"2025-10-28T15:11:36Z","snapshot_observed_at":"2026-07-29T19:20:21.974239Z","submitted_at":"2025-05-16T08:26:59Z","title":"Group-in-Group Policy Optimization for LLM Agent Training","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.10978","snapshot_observed_at":"2026-08-07T19:53:25.400799Z","title":"arXiv preprint arXiv:2505.10978 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05987","last_updated":"2026-08-06T13:00:59Z","snapshot_observed_at":"2026-08-09T20:13:11.745301Z","submitted_at":"2026-08-06T13:00:59Z","title":"AgentOPSD: Recursive Self-Distillation for Agentic Reinforcement Learning","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-07T19:53:25.400799Z"},"links":{"cited_paper":"/paper/2505.10978","citing_paper":"/paper/2608.05987"},"observation_digest":"sha256:c259a456abc88679efbb0541d346b03cf33f37bdc95ab281d00a78920c2a531d","observation_id":"59f97e98-7067-418a-9b87-e5456bdee721","resolution":{"observed_at":"2026-08-07T19:53:25.400799Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.03533","last_updated":"2024-02-22T06:21:51Z","snapshot_observed_at":"2026-07-06T14:27:46.217000Z","submitted_at":"2022-12-07T09:25:54Z","title":"Text Embeddings by Weakly-Supervised Contrastive Pre-training","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.03533","snapshot_observed_at":"2026-08-07T19:53:25.407335Z","title":"arXiv preprint arXiv:2212.03533 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05987","last_updated":"2026-08-06T13:00:59Z","snapshot_observed_at":"2026-08-09T20:13:11.745301Z","submitted_at":"2026-08-06T13:00:59Z","title":"AgentOPSD: Recursive Self-Distillation for Agentic Reinforcement Learning","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-07T19:53:25.407335Z"},"links":{"cited_paper":"/paper/2212.03533","citing_paper":"/paper/2608.05987"},"observation_digest":"sha256:2921654541d083bab44b31abe643a48439d54dfe7c853c50ba240f1159189499","observation_id":"0799257c-2fd8-465b-8d62-1b94be6143c5","resolution":{"observed_at":"2026-08-07T19:53:25.407335Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-07T19:53:25.413689Z","title":"arXiv preprint arXiv:2501.12948 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05987","last_updated":"2026-08-06T13:00:59Z","snapshot_observed_at":"2026-08-09T20:13:11.745301Z","submitted_at":"2026-08-06T13:00:59Z","title":"AgentOPSD: Recursive Self-Distillation for Agentic Reinforcement Learning","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-07T19:53:25.413689Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2608.05987"},"observation_digest":"sha256:7a6a9f55fc74251033f0c37848a910aec79e1d1a143e0674a2f428c44b81fd37","observation_id":"e19984f0-4bd1-49d2-a2f6-1f328b391069","resolution":{"observed_at":"2026-08-07T19:53:25.413689Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-07T19:53:25.418872Z","title":"arXiv preprint arXiv:2402.03300 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05987","last_updated":"2026-08-06T13:00:59Z","snapshot_observed_at":"2026-08-09T20:13:11.745301Z","submitted_at":"2026-08-06T13:00:59Z","title":"AgentOPSD: Recursive Self-Distillation for Agentic Reinforcement Learning","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-07T19:53:25.418872Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2608.05987"},"observation_digest":"sha256:d4939aa0c84585ae457c2d7021601fa508c50e6e8904cbc65863db71bc8cfe54","observation_id":"19a84209-762e-4208-8078-1552acbeca38","resolution":{"observed_at":"2026-08-07T19:53:25.418872Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T19:53:25.424814Z","title":"2026 , eprint=","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.05987","last_updated":"2026-08-06T13:00:59Z","snapshot_observed_at":"2026-08-09T20:13:11.745301Z","submitted_at":"2026-08-06T13:00:59Z","title":"AgentOPSD: Recursive Self-Distillation for Agentic Reinforcement Learning","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-07T19:53:25.424814Z"},"links":{"citing_paper":"/paper/2608.05987"},"observation_digest":"sha256:98e3dd37b1bff32a8310b76a7f5c77430ab9ad7d86d29f6809e3dad567fa158e","observation_id":"ed2c257f-72f6-4040-8532-4305bb8a4b74","resolution":{"observed_at":"2026-08-07T19:53:25.424814Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T19:53:28.935055Z","title":null,"venue":null,"work_id":"a9c31a73-047b-4f07-bb74-33a5a7989f84","year":null},"citing_paper":{"arxiv_id":"2608.05987","last_updated":"2026-08-06T13:00:59Z","snapshot_observed_at":"2026-08-09T20:13:11.745301Z","submitted_at":"2026-08-06T13:00:59Z","title":"AgentOPSD: Recursive Self-Distillation for Agentic Reinforcement Learning","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-07T19:53:25.429457Z"},"links":{"citing_paper":"/paper/2608.05987"},"observation_digest":"sha256:638a6223df921b598d99b9e612b3b4aedf89c6e4f264a404a14a1ab39b62d1dd","observation_id":"435bca4a-1b8b-4bbf-babb-8c9198a3daf4","resolution":{"observed_at":"2026-08-07T19:53:28.960790Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-08-07T19:53:25.434211Z","title":"arXiv preprint arXiv:2505.09388 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05987","last_updated":"2026-08-06T13:00:59Z","snapshot_observed_at":"2026-08-09T20:13:11.745301Z","submitted_at":"2026-08-06T13:00:59Z","title":"AgentOPSD: Recursive Self-Distillation for Agentic Reinforcement Learning","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-07T19:53:25.434211Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2608.05987"},"observation_digest":"sha256:d6e670fa87b541c9c7b106fd665e10570008d005caae8b80e3e0a56d40034add","observation_id":"9b77dde9-97cb-4019-9b5b-082451aeb98a","resolution":{"observed_at":"2026-08-07T19:53:25.434211Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.20534","last_updated":"2026-02-03T04:57:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-28T05:35:43Z","title":"Kimi K2: Open Agentic Intelligence","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.20534","snapshot_observed_at":"2026-08-07T19:53:25.438567Z","title":"arXiv preprint arXiv:2507.20534 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05987","last_updated":"2026-08-06T13:00:59Z","snapshot_observed_at":"2026-08-09T20:13:11.745301Z","submitted_at":"2026-08-06T13:00:59Z","title":"AgentOPSD: Recursive Self-Distillation for Agentic Reinforcement Learning","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-07T19:53:25.438567Z"},"links":{"cited_paper":"/paper/2507.20534","citing_paper":"/paper/2608.05987"},"observation_digest":"sha256:5136bd6af3d37a49c647c9e70982633af13a83c395cc90cdce6d50e49f608d37","observation_id":"d481ff67-37a9-46e6-9107-65384b2c8bc8","resolution":{"observed_at":"2026-08-07T19:53:25.438567Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T19:53:28.879025Z","title":"Proceedings of the AAAI Conference on Artificial Intelligence , volume=","venue":null,"work_id":"41a6ec35-b556-41cd-b21c-0092a8f496cf","year":null},"citing_paper":{"arxiv_id":"2608.05987","last_updated":"2026-08-06T13:00:59Z","snapshot_observed_at":"2026-08-09T20:13:11.745301Z","submitted_at":"2026-08-06T13:00:59Z","title":"AgentOPSD: Recursive Self-Distillation for Agentic Reinforcement Learning","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-07T19:53:25.444028Z"},"links":{"citing_paper":"/paper/2608.05987"},"observation_digest":"sha256:19ad902f8fdc80bc95053917f40698c37720444061da87c9275db7cd2c33ae2c","observation_id":"3763a7ad-38f7-4568-ae6b-fe66c08fd348","resolution":{"observed_at":"2026-08-07T19:53:28.902064Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T19:53:28.816285Z","title":"Proceedings of the ACM on Web Conference 2025 , pages=","venue":null,"work_id":"996b5003-c87a-4fce-beb4-387311667ae1","year":2025},"citing_paper":{"arxiv_id":"2608.05987","last_updated":"2026-08-06T13:00:59Z","snapshot_observed_at":"2026-08-09T20:13:11.745301Z","submitted_at":"2026-08-06T13:00:59Z","title":"AgentOPSD: Recursive Self-Distillation for Agentic Reinforcement Learning","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-07T19:53:25.449543Z"},"links":{"citing_paper":"/paper/2608.05987"},"observation_digest":"sha256:17db7725deb5337604bae9527f006d91cffa90db659c0c8f216a758c35b9bfd6","observation_id":"c197bb77-bb0a-48d7-9159-3b7a12768644","resolution":{"observed_at":"2026-08-07T19:53:28.850775Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.06261","last_updated":"2025-12-19T14:25:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-07T17:36:04Z","title":"Gemini 2.5: Pushing the Frontier with Advanced Reasoning, Multimodality, Long Context, and Next Generation Agentic Capabilities","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.06261","snapshot_observed_at":"2026-08-07T19:53:25.454538Z","title":"arXiv preprint arXiv:2507.06261 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05987","last_updated":"2026-08-06T13:00:59Z","snapshot_observed_at":"2026-08-09T20:13:11.745301Z","submitted_at":"2026-08-06T13:00:59Z","title":"AgentOPSD: Recursive Self-Distillation for Agentic Reinforcement Learning","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-07T19:53:25.454538Z"},"links":{"cited_paper":"/paper/2507.06261","citing_paper":"/paper/2608.05987"},"observation_digest":"sha256:74df97c8339a57bd04bd2ddb25734165cff195be30cdaa8a9dce7f261dc3bb9d","observation_id":"bbbdf02e-35a0-456f-8d4c-fce5ee880c45","resolution":{"observed_at":"2026-08-07T19:53:25.454538Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T19:53:25.459799Z","title":"arXiv preprint arXiv:2601.16725 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05987","last_updated":"2026-08-06T13:00:59Z","snapshot_observed_at":"2026-08-09T20:13:11.745301Z","submitted_at":"2026-08-06T13:00:59Z","title":"AgentOPSD: Recursive Self-Distillation for Agentic Reinforcement Learning","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-07T19:53:25.459799Z"},"links":{"citing_paper":"/paper/2608.05987"},"observation_digest":"sha256:8df78a4d47077a0876c6f0ab14edd00623d67fbb95f1f5ad08c4f0d177d474b7","observation_id":"4862341c-860a-4872-984e-94d3f753b5e5","resolution":{"observed_at":"2026-08-07T19:53:25.459799Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21276","last_updated":"2024-10-25T17:43:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-25T17:43:01Z","title":"GPT-4o System Card","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.21276","snapshot_observed_at":"2026-08-07T19:53:25.464858Z","title":"arXiv preprint arXiv:2410.21276 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05987","last_updated":"2026-08-06T13:00:59Z","snapshot_observed_at":"2026-08-09T20:13:11.745301Z","submitted_at":"2026-08-06T13:00:59Z","title":"AgentOPSD: Recursive Self-Distillation for Agentic Reinforcement Learning","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-07T19:53:25.464858Z"},"links":{"cited_paper":"/paper/2410.21276","citing_paper":"/paper/2608.05987"},"observation_digest":"sha256:2760e305685423c49ef529ccd3a7166ab21468b8f0d0adcdf206b9c7c0d2403b","observation_id":"3057d07f-715f-4706-a0eb-4d67daca02a5","resolution":{"observed_at":"2026-08-07T19:53:25.464858Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T19:53:25.470259Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05987","last_updated":"2026-08-06T13:00:59Z","snapshot_observed_at":"2026-08-09T20:13:11.745301Z","submitted_at":"2026-08-06T13:00:59Z","title":"AgentOPSD: Recursive Self-Distillation for Agentic Reinforcement Learning","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-07T19:53:25.470259Z"},"links":{"citing_paper":"/paper/2608.05987"},"observation_digest":"sha256:8fe7eaf81eb50621d4361c604d03829f116e9e0bfaee4c829825344fc1900ff1","observation_id":"08ba990a-7737-4c8c-828d-c4f80992a5dd","resolution":{"observed_at":"2026-08-07T19:53:25.470259Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06770","last_updated":"2024-11-11T23:05:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-10T16:47:29Z","title":"SWE-bench: Can Language Models Resolve Real-World GitHub Issues?","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06770","snapshot_observed_at":"2026-08-07T19:53:25.475258Z","title":"arXiv preprint arXiv:2310.06770 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05987","last_updated":"2026-08-06T13:00:59Z","snapshot_observed_at":"2026-08-09T20:13:11.745301Z","submitted_at":"2026-08-06T13:00:59Z","title":"AgentOPSD: Recursive Self-Distillation for Agentic Reinforcement Learning","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-07T19:53:25.475258Z"},"links":{"cited_paper":"/paper/2310.06770","citing_paper":"/paper/2608.05987"},"observation_digest":"sha256:03aeb151fbf3e4bf42123e829efd372decbb8d6edeb25e08890ff16d1f4c9ffd","observation_id":"1e755faf-f6ac-40fe-96e7-97639f0b215f","resolution":{"observed_at":"2026-08-07T19:53:25.475258Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.19849","last_updated":"2025-07-26T07:53:11Z","snapshot_observed_at":"2026-07-06T22:03:15.296567Z","submitted_at":"2025-07-26T07:53:11Z","title":"Agentic Reinforced Policy Optimization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.19849","snapshot_observed_at":"2026-08-07T19:53:25.480329Z","title":"arXiv preprint arXiv:2507.19849 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05987","last_updated":"2026-08-06T13:00:59Z","snapshot_observed_at":"2026-08-09T20:13:11.745301Z","submitted_at":"2026-08-06T13:00:59Z","title":"AgentOPSD: Recursive Self-Distillation for Agentic Reinforcement Learning","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-07T19:53:25.480329Z"},"links":{"cited_paper":"/paper/2507.19849","citing_paper":"/paper/2608.05987"},"observation_digest":"sha256:27aa422590403bd3ae7cff57c871eaf7c07b6b1fa8f9e1abfd3a6a17b244f1d1","observation_id":"dc2c9a41-6e4e-4169-98b9-6e3b1d2631e2","resolution":{"observed_at":"2026-08-07T19:53:25.480329Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T19:53:25.484747Z","title":"2026 , eprint=","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.05987","last_updated":"2026-08-06T13:00:59Z","snapshot_observed_at":"2026-08-09T20:13:11.745301Z","submitted_at":"2026-08-06T13:00:59Z","title":"AgentOPSD: Recursive Self-Distillation for Agentic Reinforcement Learning","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-07T19:53:25.484747Z"},"links":{"citing_paper":"/paper/2608.05987"},"observation_digest":"sha256:fe3018b03c2e2e6097306789962445d6898798e818139409f5fe7e184e582533","observation_id":"e08336bb-95f8-45eb-ac97-0cc0c28fcf84","resolution":{"observed_at":"2026-08-07T19:53:25.484747Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T19:53:25.511208Z","title":"2026 , eprint=","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.05987","last_updated":"2026-08-06T13:00:59Z","snapshot_observed_at":"2026-08-09T20:13:11.745301Z","submitted_at":"2026-08-06T13:00:59Z","title":"AgentOPSD: Recursive Self-Distillation for Agentic Reinforcement Learning","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-07T19:53:25.511208Z"},"links":{"citing_paper":"/paper/2608.05987"},"observation_digest":"sha256:0287852a2584b6365a5c9cd85254cde5d740419f291070a0fbac5f9792d5b903","observation_id":"572c8c8f-2052-4491-9a37-6cd4287f1e2d","resolution":{"observed_at":"2026-08-07T19:53:25.511208Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T19:53:25.549779Z","title":"2026 , eprint=","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.05987","last_updated":"2026-08-06T13:00:59Z","snapshot_observed_at":"2026-08-09T20:13:11.745301Z","submitted_at":"2026-08-06T13:00:59Z","title":"AgentOPSD: Recursive Self-Distillation for Agentic Reinforcement Learning","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-07T19:53:25.549779Z"},"links":{"citing_paper":"/paper/2608.05987"},"observation_digest":"sha256:8e5cae722c1995a2c75e8c5d6e10e1f5860874fac9816e8a84fda271e5269b11","observation_id":"eafcfba5-3be3-4aa8-b6e1-d2ba35632447","resolution":{"observed_at":"2026-08-07T19:53:25.549779Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T19:53:25.564156Z","title":"2026 , eprint=","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.05987","last_updated":"2026-08-06T13:00:59Z","snapshot_observed_at":"2026-08-09T20:13:11.745301Z","submitted_at":"2026-08-06T13:00:59Z","title":"AgentOPSD: Recursive Self-Distillation for Agentic Reinforcement Learning","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-07T19:53:25.564156Z"},"links":{"citing_paper":"/paper/2608.05987"},"observation_digest":"sha256:86403c3199086033d45b5bc675ccd5dbaaf3e0c8bf03525cea37ea6e9de0f1fc","observation_id":"0782cfde-7851-4e2e-ac2c-4037575d4ff3","resolution":{"observed_at":"2026-08-07T19:53:25.564156Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T19:53:25.595205Z","title":"2026 , eprint=","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.05987","last_updated":"2026-08-06T13:00:59Z","snapshot_observed_at":"2026-08-09T20:13:11.745301Z","submitted_at":"2026-08-06T13:00:59Z","title":"AgentOPSD: Recursive Self-Distillation for Agentic Reinforcement Learning","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-07T19:53:25.595205Z"},"links":{"citing_paper":"/paper/2608.05987"},"observation_digest":"sha256:dff29ac32015024c1cdff2b1529e201f654cf3592941fac358832e202a59471b","observation_id":"8afca331-ee0c-4835-bc1b-a594829a9ecc","resolution":{"observed_at":"2026-08-07T19:53:25.595205Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T19:53:28.571676Z","title":"2026 , eprint=","venue":null,"work_id":"1e87d5a9-527b-4d78-879f-66998feda13e","year":2026},"citing_paper":{"arxiv_id":"2608.05987","last_updated":"2026-08-06T13:00:59Z","snapshot_observed_at":"2026-08-09T20:13:11.745301Z","submitted_at":"2026-08-06T13:00:59Z","title":"AgentOPSD: Recursive Self-Distillation for Agentic Reinforcement Learning","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-07T19:53:25.623667Z"},"links":{"citing_paper":"/paper/2608.05987"},"observation_digest":"sha256:75336c908509f0b8d72c651a7358a12f51b9efd7b68e8abfb13349ef3d7109ca","observation_id":"6655eeed-dbc9-4b51-b32e-426f2c580a98","resolution":{"observed_at":"2026-08-07T19:53:28.619108Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T19:53:25.647136Z","title":"2023 , eprint=","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.05987","last_updated":"2026-08-06T13:00:59Z","snapshot_observed_at":"2026-08-09T20:13:11.745301Z","submitted_at":"2026-08-06T13:00:59Z","title":"AgentOPSD: Recursive Self-Distillation for Agentic Reinforcement Learning","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-07T19:53:25.647136Z"},"links":{"citing_paper":"/paper/2608.05987"},"observation_digest":"sha256:630000e5c9a300081827a8ab8ac5cd127f84ecec66c06261bc5519246b91247e","observation_id":"d506fd67-ed4c-452e-9700-251ccf57922a","resolution":{"observed_at":"2026-08-07T19:53:25.647136Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T19:53:25.671107Z","title":"2011 , eprint=","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2608.05987","last_updated":"2026-08-06T13:00:59Z","snapshot_observed_at":"2026-08-09T20:13:11.745301Z","submitted_at":"2026-08-06T13:00:59Z","title":"AgentOPSD: Recursive Self-Distillation for Agentic Reinforcement Learning","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-07T19:53:25.671107Z"},"links":{"citing_paper":"/paper/2608.05987"},"observation_digest":"sha256:bcea03ee9cf2605a87b60d238e24c498b2f77705e56527715faffda78beccac8","observation_id":"0694b948-1b45-429c-b819-511adca85e8b","resolution":{"observed_at":"2026-08-07T19:53:25.671107Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T19:53:25.719544Z","title":"2026 , eprint=","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.05987","last_updated":"2026-08-06T13:00:59Z","snapshot_observed_at":"2026-08-09T20:13:11.745301Z","submitted_at":"2026-08-06T13:00:59Z","title":"AgentOPSD: Recursive Self-Distillation for Agentic Reinforcement Learning","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-07T19:53:25.719544Z"},"links":{"citing_paper":"/paper/2608.05987"},"observation_digest":"sha256:13a029b224411b7ec7ab0de0919627d56a3c30543dfb76eee93c03b2dddf2a47","observation_id":"9d9835cf-a47d-46c9-a800-00dddecdce5e","resolution":{"observed_at":"2026-08-07T19:53:25.719544Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T19:53:28.420425Z","title":"2019 , eprint=","venue":null,"work_id":"088c8c5d-11ed-488a-9cae-d6e04505dafc","year":2019},"citing_paper":{"arxiv_id":"2608.05987","last_updated":"2026-08-06T13:00:59Z","snapshot_observed_at":"2026-08-09T20:13:11.745301Z","submitted_at":"2026-08-06T13:00:59Z","title":"AgentOPSD: Recursive Self-Distillation for Agentic Reinforcement Learning","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-07T19:53:25.744472Z"},"links":{"citing_paper":"/paper/2608.05987"},"observation_digest":"sha256:663c4177c2731c41886a7ebf18d0c34d8043087af01a1354e4f0d96ad295867c","observation_id":"51d3c44d-c768-4c71-8091-f0dc1852d21d","resolution":{"observed_at":"2026-08-07T19:53:28.481273Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.15144","last_updated":"2025-09-01T05:38:34Z","snapshot_observed_at":"2026-07-06T22:15:55.690108Z","submitted_at":"2025-08-21T00:39:12Z","title":"Mobile-Agent-v3: Fundamental Agents for GUI Automation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.15144","snapshot_observed_at":"2026-08-07T19:53:25.765585Z","title":"arXiv preprint arXiv:2508.15144 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05987","last_updated":"2026-08-06T13:00:59Z","snapshot_observed_at":"2026-08-09T20:13:11.745301Z","submitted_at":"2026-08-06T13:00:59Z","title":"AgentOPSD: Recursive Self-Distillation for Agentic Reinforcement Learning","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-07T19:53:25.765585Z"},"links":{"cited_paper":"/paper/2508.15144","citing_paper":"/paper/2608.05987"},"observation_digest":"sha256:dd56e817483aa2ab280566414efa4d54f043381db95afb7b47f6c28183fb6c2a","observation_id":"26c3af54-464c-4908-9818-21de4473cd16","resolution":{"observed_at":"2026-08-07T19:53:25.765585Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.16291","last_updated":"2023-10-19T16:27:03Z","snapshot_observed_at":"2026-08-07T08:29:46.650400Z","submitted_at":"2023-05-25T17:46:38Z","title":"Voyager: An Open-Ended Embodied Agent with Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.16291","snapshot_observed_at":"2026-08-07T19:53:25.786093Z","title":"arXiv preprint arXiv:2305.16291 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05987","last_updated":"2026-08-06T13:00:59Z","snapshot_observed_at":"2026-08-09T20:13:11.745301Z","submitted_at":"2026-08-06T13:00:59Z","title":"AgentOPSD: Recursive Self-Distillation for Agentic Reinforcement Learning","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-07T19:53:25.786093Z"},"links":{"cited_paper":"/paper/2305.16291","citing_paper":"/paper/2608.05987"},"observation_digest":"sha256:a3ea590577afa4432fc60cf838aa23715edb0c3aa9feded871ee78e2791bf072","observation_id":"69b7dcf3-89c5-4f58-878c-33c07661a583","resolution":{"observed_at":"2026-08-07T19:53:25.786093Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T19:53:25.791433Z","title":"2024 , eprint=","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.05987","last_updated":"2026-08-06T13:00:59Z","snapshot_observed_at":"2026-08-09T20:13:11.745301Z","submitted_at":"2026-08-06T13:00:59Z","title":"AgentOPSD: Recursive Self-Distillation for Agentic Reinforcement Learning","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-07T19:53:25.791433Z"},"links":{"citing_paper":"/paper/2608.05987"},"observation_digest":"sha256:c28c7d5e0771abbe7d3d4e193b118e67d75820a789e0451324c9c8253a604ad5","observation_id":"d0db4c0b-5dc5-4c92-861a-cdd6372cfdf0","resolution":{"observed_at":"2026-08-07T19:53:25.791433Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T19:53:25.796098Z","title":"2026 , eprint=","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.05987","last_updated":"2026-08-06T13:00:59Z","snapshot_observed_at":"2026-08-09T20:13:11.745301Z","submitted_at":"2026-08-06T13:00:59Z","title":"AgentOPSD: Recursive Self-Distillation for Agentic Reinforcement Learning","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-07T19:53:25.796098Z"},"links":{"citing_paper":"/paper/2608.05987"},"observation_digest":"sha256:ae4863a4b3b284a59a6a3fcf8df390c982cf6e02c3ddf3ed0752fecddeea3fa7","observation_id":"eee1988e-068f-45b6-b20e-d4002c8314f8","resolution":{"observed_at":"2026-08-07T19:53:25.796098Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T19:53:25.800734Z","title":"2023 , eprint=","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.05987","last_updated":"2026-08-06T13:00:59Z","snapshot_observed_at":"2026-08-09T20:13:11.745301Z","submitted_at":"2026-08-06T13:00:59Z","title":"AgentOPSD: Recursive Self-Distillation for Agentic Reinforcement Learning","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-07T19:53:25.800734Z"},"links":{"citing_paper":"/paper/2608.05987"},"observation_digest":"sha256:18f994dfea673bd53000474960852a569cc0587857b780249a1dd3abdf18fb89","observation_id":"97c813f3-7da2-420d-a63b-8389b4d8abb0","resolution":{"observed_at":"2026-08-07T19:53:25.800734Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14476","last_updated":"2025-05-20T01:37:34Z","snapshot_observed_at":"2026-08-02T01:40:54.187278Z","submitted_at":"2025-03-18T17:49:06Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.14476","snapshot_observed_at":"2026-08-07T19:53:25.805370Z","title":"arXiv preprint arXiv:2503.14476 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05987","last_updated":"2026-08-06T13:00:59Z","snapshot_observed_at":"2026-08-09T20:13:11.745301Z","submitted_at":"2026-08-06T13:00:59Z","title":"AgentOPSD: Recursive Self-Distillation for Agentic Reinforcement Learning","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-07T19:53:25.805370Z"},"links":{"cited_paper":"/paper/2503.14476","citing_paper":"/paper/2608.05987"},"observation_digest":"sha256:c1552e8e5cafde3e6f293a441880a07ed5636d51e1057af5e43e6021a2c31047","observation_id":"53474c2f-3fdb-4541-b82d-b9b86cbf9833","resolution":{"observed_at":"2026-08-07T19:53:25.805370Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T19:53:28.283781Z","title":"2026 , eprint=","venue":null,"work_id":"118f44e9-7f84-42c5-a7bd-1a242c6040ef","year":2026},"citing_paper":{"arxiv_id":"2608.05987","last_updated":"2026-08-06T13:00:59Z","snapshot_observed_at":"2026-08-09T20:13:11.745301Z","submitted_at":"2026-08-06T13:00:59Z","title":"AgentOPSD: Recursive Self-Distillation for Agentic Reinforcement Learning","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-07T19:53:25.814977Z"},"links":{"citing_paper":"/paper/2608.05987"},"observation_digest":"sha256:9b134f5ce29948318bc4de0dc3c0152186d562be0793300034c52166c56a3e64","observation_id":"3236c731-949b-4c7e-9279-ebe740505a87","resolution":{"observed_at":"2026-08-07T19:53:28.317587Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T19:53:25.824341Z","title":"arXiv preprint arXiv:2602.03048 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05987","last_updated":"2026-08-06T13:00:59Z","snapshot_observed_at":"2026-08-09T20:13:11.745301Z","submitted_at":"2026-08-06T13:00:59Z","title":"AgentOPSD: Recursive Self-Distillation for Agentic Reinforcement Learning","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-07T19:53:25.824341Z"},"links":{"citing_paper":"/paper/2608.05987"},"observation_digest":"sha256:6aa9cee991ac9dd2d7fe39e8fa38430037acf631839d6b438757dee34b02b8dc","observation_id":"d6c29359-0c29-4e01-a06c-fa5bb5030e1f","resolution":{"observed_at":"2026-08-07T19:53:25.824341Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T19:53:28.216894Z","title":"2026 , eprint=","venue":null,"work_id":"1f43bd2e-fdda-4598-b2a4-66152e9bb372","year":2026},"citing_paper":{"arxiv_id":"2608.05987","last_updated":"2026-08-06T13:00:59Z","snapshot_observed_at":"2026-08-09T20:13:11.745301Z","submitted_at":"2026-08-06T13:00:59Z","title":"AgentOPSD: Recursive Self-Distillation for Agentic Reinforcement Learning","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-07T19:53:25.837906Z"},"links":{"citing_paper":"/paper/2608.05987"},"observation_digest":"sha256:06bb292ad797f0a92f08bdc1ebde04bb8a00538fccc473b766e76faa49d6fdc3","observation_id":"c9e66127-70dc-4a95-9552-615c82320dc8","resolution":{"observed_at":"2026-08-07T19:53:28.237592Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T19:53:28.202135Z","title":"2026 , eprint=","venue":null,"work_id":"7af3bc20-a2d9-4713-81db-061f66d8ef7e","year":2026},"citing_paper":{"arxiv_id":"2608.05987","last_updated":"2026-08-06T13:00:59Z","snapshot_observed_at":"2026-08-09T20:13:11.745301Z","submitted_at":"2026-08-06T13:00:59Z","title":"AgentOPSD: Recursive Self-Distillation for Agentic Reinforcement Learning","version":1},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-07T19:53:25.854963Z"},"links":{"citing_paper":"/paper/2608.05987"},"observation_digest":"sha256:72029e75cfea2eb65710324e89c8c5a0bc4ed7bf904003b56bb22267567fd0b9","observation_id":"21728072-1869-488f-9096-e1cef7744cfa","resolution":{"observed_at":"2026-08-07T19:53:28.206314Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T19:53:28.186101Z","title":"2026 , eprint=","venue":null,"work_id":"e969f7eb-29f6-4de2-b0c8-cfcf12f6fdbb","year":2026},"citing_paper":{"arxiv_id":"2608.05987","last_updated":"2026-08-06T13:00:59Z","snapshot_observed_at":"2026-08-09T20:13:11.745301Z","submitted_at":"2026-08-06T13:00:59Z","title":"AgentOPSD: Recursive Self-Distillation for Agentic Reinforcement Learning","version":1},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-07T19:53:25.868092Z"},"links":{"citing_paper":"/paper/2608.05987"},"observation_digest":"sha256:87eb9787c1be565c868180824d423b785330afeb6934e8215441dbe968bec2df","observation_id":"34ea40fb-8d47-4cd8-9d2d-bbc6dac40c63","resolution":{"observed_at":"2026-08-07T19:53:28.190864Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T19:53:25.872410Z","title":"2017 , eprint=","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2608.05987","last_updated":"2026-08-06T13:00:59Z","snapshot_observed_at":"2026-08-09T20:13:11.745301Z","submitted_at":"2026-08-06T13:00:59Z","title":"AgentOPSD: Recursive Self-Distillation for Agentic Reinforcement Learning","version":1},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-07T19:53:25.872410Z"},"links":{"citing_paper":"/paper/2608.05987"},"observation_digest":"sha256:fb912b2e6171410348ac5a8cd22683f878b9b9d23739a00b974128ac47131a0e","observation_id":"9808c1ba-c370-49b1-9be9-5c1f14521c1d","resolution":{"observed_at":"2026-08-07T19:53:25.872410Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T19:53:28.161110Z","title":"2016 , eprint=","venue":null,"work_id":"86476024-a959-47ec-9e5e-a668bfc09bfe","year":2016},"citing_paper":{"arxiv_id":"2608.05987","last_updated":"2026-08-06T13:00:59Z","snapshot_observed_at":"2026-08-09T20:13:11.745301Z","submitted_at":"2026-08-06T13:00:59Z","title":"AgentOPSD: Recursive Self-Distillation for Agentic Reinforcement Learning","version":1},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-07T19:53:25.877195Z"},"links":{"citing_paper":"/paper/2608.05987"},"observation_digest":"sha256:adab3164f7eca8c46b67a9d4e40b42facf134d196865aa1bf820a72be82d14bb","observation_id":"af5e4c2e-d7f3-4cad-b2d3-cda22e9a7338","resolution":{"observed_at":"2026-08-07T19:53:28.165787Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T19:53:28.144768Z","title":"2019 , eprint=","venue":null,"work_id":"fcfa00ae-e05a-4835-8e98-a10f9eb44986","year":2019},"citing_paper":{"arxiv_id":"2608.05987","last_updated":"2026-08-06T13:00:59Z","snapshot_observed_at":"2026-08-09T20:13:11.745301Z","submitted_at":"2026-08-06T13:00:59Z","title":"AgentOPSD: Recursive Self-Distillation for Agentic Reinforcement Learning","version":1},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-07T19:53:25.882562Z"},"links":{"citing_paper":"/paper/2608.05987"},"observation_digest":"sha256:ad99ca622d7b5ec507a1703964cad1c2743df6ca4156b63a4eab0cb60ccc075b","observation_id":"571504e8-9896-4662-9772-a7c3a091c430","resolution":{"observed_at":"2026-08-07T19:53:28.149599Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T19:53:28.129554Z","title":"2024 , eprint=","venue":null,"work_id":"2a486e83-c633-4851-a5c0-7bf2ffbb0b63","year":2024},"citing_paper":{"arxiv_id":"2608.05987","last_updated":"2026-08-06T13:00:59Z","snapshot_observed_at":"2026-08-09T20:13:11.745301Z","submitted_at":"2026-08-06T13:00:59Z","title":"AgentOPSD: Recursive Self-Distillation for Agentic Reinforcement Learning","version":1},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-08-07T19:53:25.887615Z"},"links":{"citing_paper":"/paper/2608.05987"},"observation_digest":"sha256:1c4962d810d896fb0f6a29c2069d0cc00a45c5f705ba0fec09234bf56b089a9f","observation_id":"a7b45576-74ae-44ce-9fa0-e0d633787833","resolution":{"observed_at":"2026-08-07T19:53:28.134605Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T19:53:25.892424Z","title":"2025 , eprint=","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.05987","last_updated":"2026-08-06T13:00:59Z","snapshot_observed_at":"2026-08-09T20:13:11.745301Z","submitted_at":"2026-08-06T13:00:59Z","title":"AgentOPSD: Recursive Self-Distillation for Agentic Reinforcement Learning","version":1},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-08-07T19:53:25.892424Z"},"links":{"citing_paper":"/paper/2608.05987"},"observation_digest":"sha256:bb32537acc45e1ad4d7ff87ebaeaaeae096690a2b26b4bd5665dac76ef633abb","observation_id":"d362eef3-4808-431e-8529-c8335ed30d54","resolution":{"observed_at":"2026-08-07T19:53:25.892424Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T19:53:28.102685Z","title":"Journal of the American Statistical Association , volume=","venue":null,"work_id":"81a7f1bf-a359-4472-8780-98cd3707534d","year":1995},"citing_paper":{"arxiv_id":"2608.05987","last_updated":"2026-08-06T13:00:59Z","snapshot_observed_at":"2026-08-09T20:13:11.745301Z","submitted_at":"2026-08-06T13:00:59Z","title":"AgentOPSD: Recursive Self-Distillation for Agentic Reinforcement Learning","version":1},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-08-07T19:53:25.896700Z"},"links":{"citing_paper":"/paper/2608.05987"},"observation_digest":"sha256:7be9e1986ada62f6225ba8fdad8282ab73b6c7f00fdbd564ee95b259e601f55d","observation_id":"3bc4c876-61cf-4ab1-a78b-c0ae6c7cb9d3","resolution":{"observed_at":"2026-08-07T19:53:28.107894Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T19:53:28.085812Z","title":"The Annals of Mathematical Statistics , volume=","venue":null,"work_id":"c7c96046-68e4-48d1-a5ee-134c050eae3b","year":1945},"citing_paper":{"arxiv_id":"2608.05987","last_updated":"2026-08-06T13:00:59Z","snapshot_observed_at":"2026-08-09T20:13:11.745301Z","submitted_at":"2026-08-06T13:00:59Z","title":"AgentOPSD: Recursive Self-Distillation for Agentic Reinforcement Learning","version":1},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-08-07T19:53:25.901640Z"},"links":{"citing_paper":"/paper/2608.05987"},"observation_digest":"sha256:d461051a90153710790e1e79366bdab4ac3721edd8293f3ecf328da174620dec","observation_id":"cbb49228-4cbd-44e1-b1c6-5957ad50e682","resolution":{"observed_at":"2026-08-07T19:53:28.091321Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2607.14777","last_updated":"2026-07-16T09:57:18Z","snapshot_observed_at":"2026-08-09T03:27:13.521286Z","submitted_at":"2026-07-16T09:57:18Z","title":"SEED: Self-Evolving On-Policy Distillation for Agentic Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2607.14777","snapshot_observed_at":"2026-08-07T19:53:25.906690Z","title":"arXiv preprint arXiv:2607.14777 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05987","last_updated":"2026-08-06T13:00:59Z","snapshot_observed_at":"2026-08-09T20:13:11.745301Z","submitted_at":"2026-08-06T13:00:59Z","title":"AgentOPSD: Recursive Self-Distillation for Agentic Reinforcement Learning","version":1},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-08-07T19:53:25.906690Z"},"links":{"cited_paper":"/paper/2607.14777","citing_paper":"/paper/2608.05987"},"observation_digest":"sha256:fb3bba67cd37195a486b59fa9fcae341bb4c02211f2ea1bf7ac91657e2c1a64e","observation_id":"0c69cbd7-d25b-445e-a4ff-0cc00bd9f76b","resolution":{"observed_at":"2026-08-07T19:53:25.906690Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2606.26790","last_updated":"2026-06-25T09:24:09Z","snapshot_observed_at":"2026-08-07T13:00:04.957958Z","submitted_at":"2026-06-25T09:24:09Z","title":"OPID: On-Policy Skill Distillation for Agentic Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2606.26790","doi":null,"metadata_source":"pith","pith_arxiv_id":"2606.26790","snapshot_observed_at":"2026-08-07T19:53:27.082155Z","title":"OPID: On-Policy Skill Distillation for Agentic Reinforcement Learning","venue":"cs.CL","work_id":"51221153-2897-4ec2-9ba6-961032e8237f","year":2026},"citing_paper":{"arxiv_id":"2608.05987","last_updated":"2026-08-06T13:00:59Z","snapshot_observed_at":"2026-08-09T20:13:11.745301Z","submitted_at":"2026-08-06T13:00:59Z","title":"AgentOPSD: Recursive Self-Distillation for Agentic Reinforcement Learning","version":1},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-08-07T19:53:25.911804Z"},"links":{"cited_paper":"/paper/2606.26790","citing_paper":"/paper/2608.05987"},"observation_digest":"sha256:8ad7419ab5368d1015776667802c3d37a18a63bbb5f5a89b17910b262a952122","observation_id":"f139449b-87b8-44c3-8130-b16a48d37b81","resolution":{"observed_at":"2026-08-07T19:53:27.087135Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2607.26784","last_updated":"2026-07-29T11:26:33Z","snapshot_observed_at":"2026-08-09T01:01:14.362201Z","submitted_at":"2026-07-29T11:26:33Z","title":"SkillRise: Agentic Reinforcement Learning for Cross-Task Skill Evolution","version":1},"cited_work":{"arxiv_id":"2607.26784","doi":null,"metadata_source":"pith","pith_arxiv_id":"2607.26784","snapshot_observed_at":"2026-08-07T19:53:27.058819Z","title":"SkillRise: Agentic Reinforcement Learning for Cross-Task Skill Evolution","venue":"cs.LG","work_id":"7d8a8639-bc40-47f0-97c3-c76175a6dc2f","year":2026},"citing_paper":{"arxiv_id":"2608.05987","last_updated":"2026-08-06T13:00:59Z","snapshot_observed_at":"2026-08-09T20:13:11.745301Z","submitted_at":"2026-08-06T13:00:59Z","title":"AgentOPSD: Recursive Self-Distillation for Agentic Reinforcement Learning","version":1},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-08-07T19:53:25.916475Z"},"links":{"cited_paper":"/paper/2607.26784","citing_paper":"/paper/2608.05987"},"observation_digest":"sha256:247398a4e4ccee1381f3ed048b299a7873aa9f90354153e91068f209dbb7e97b","observation_id":"711881f7-a651-4888-8f97-894bf50f5a8a","resolution":{"observed_at":"2026-08-07T19:53:27.063688Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2605.15155","last_updated":"2026-05-14T17:51:26Z","snapshot_observed_at":"2026-08-06T01:14:44.790846Z","submitted_at":"2026-05-14T17:51:26Z","title":"Self-Distilled Agentic Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.15155","snapshot_observed_at":"2026-08-07T19:53:25.921007Z","title":"arXiv preprint arXiv:2605.15155 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05987","last_updated":"2026-08-06T13:00:59Z","snapshot_observed_at":"2026-08-09T20:13:11.745301Z","submitted_at":"2026-08-06T13:00:59Z","title":"AgentOPSD: Recursive Self-Distillation for Agentic Reinforcement Learning","version":1},"reference_index":67,"source":"arxiv_source","source_observed_at":"2026-08-07T19:53:25.921007Z"},"links":{"cited_paper":"/paper/2605.15155","citing_paper":"/paper/2608.05987"},"observation_digest":"sha256:5af76ebecd7226a8951937fe01748a9b0f8089fc3bbcc1ba5094cc8616cd47bb","observation_id":"2822f740-672d-41cc-8588-6f1dfa8c2170","resolution":{"observed_at":"2026-08-07T19:53:25.921007Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T19:53:25.926059Z","title":"Artificial Intelligence , volume =","venue":null,"work_id":null,"year":1998},"citing_paper":{"arxiv_id":"2608.05987","last_updated":"2026-08-06T13:00:59Z","snapshot_observed_at":"2026-08-09T20:13:11.745301Z","submitted_at":"2026-08-06T13:00:59Z","title":"AgentOPSD: Recursive Self-Distillation for Agentic Reinforcement Learning","version":1},"reference_index":68,"source":"arxiv_source","source_observed_at":"2026-08-07T19:53:25.926059Z"},"links":{"citing_paper":"/paper/2608.05987"},"observation_digest":"sha256:a3dc70422bb9d304110a9c1ab53c1f54a74942e10e94364f28f04a62860c4342","observation_id":"fe8762e6-3bb4-47ce-b6a6-1854bb9d4d11","resolution":{"observed_at":"2026-08-07T19:53:25.926059Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T19:53:28.044426Z","title":"Journal of Mathematical Analysis and Applications , volume =","venue":null,"work_id":"cade9150-ad51-4be2-a6ee-5e7fe8868a83","year":1965},"citing_paper":{"arxiv_id":"2608.05987","last_updated":"2026-08-06T13:00:59Z","snapshot_observed_at":"2026-08-09T20:13:11.745301Z","submitted_at":"2026-08-06T13:00:59Z","title":"AgentOPSD: Recursive Self-Distillation for Agentic Reinforcement Learning","version":1},"reference_index":69,"source":"arxiv_source","source_observed_at":"2026-08-07T19:53:25.930651Z"},"links":{"citing_paper":"/paper/2608.05987"},"observation_digest":"sha256:bda99c33cf6c43ebe567918c3cdb141b9fcfc8d46095f0d3c773f893cfd2ac42","observation_id":"320f4540-0391-40a4-9ae5-48be7875b92c","resolution":{"observed_at":"2026-08-07T19:53:28.062099Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T19:53:25.935615Z","title":"arXiv preprint arXiv:2602.07594 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05987","last_updated":"2026-08-06T13:00:59Z","snapshot_observed_at":"2026-08-09T20:13:11.745301Z","submitted_at":"2026-08-06T13:00:59Z","title":"AgentOPSD: Recursive Self-Distillation for Agentic Reinforcement Learning","version":1},"reference_index":70,"source":"arxiv_source","source_observed_at":"2026-08-07T19:53:25.935615Z"},"links":{"citing_paper":"/paper/2608.05987"},"observation_digest":"sha256:2bae731c9b1dde1f5999684b4d351fb1fac11c2dd0a0ccbfb356a999e4153b07","observation_id":"9a0b8028-fd40-4eb3-8fe3-a26b2292cfc6","resolution":{"observed_at":"2026-08-07T19:53:25.935615Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.16143","last_updated":"2026-05-15T16:24:16Z","snapshot_observed_at":"2026-08-06T06:27:50.601885Z","submitted_at":"2026-05-15T16:24:16Z","title":"Look Before You Leap: Autonomous Exploration for LLM Agents","version":1},"cited_work":{"arxiv_id":"2605.16143","doi":null,"metadata_source":"pith","pith_arxiv_id":"2605.16143","snapshot_observed_at":"2026-08-07T19:53:26.802174Z","title":"Look Before You Leap: Autonomous Exploration for LLM Agents","venue":"cs.AI","work_id":"560866e4-6cbb-474a-a88a-103295f070f5","year":2026},"citing_paper":{"arxiv_id":"2608.05987","last_updated":"2026-08-06T13:00:59Z","snapshot_observed_at":"2026-08-09T20:13:11.745301Z","submitted_at":"2026-08-06T13:00:59Z","title":"AgentOPSD: Recursive Self-Distillation for Agentic Reinforcement Learning","version":1},"reference_index":71,"source":"arxiv_source","source_observed_at":"2026-08-07T19:53:25.940186Z"},"links":{"cited_paper":"/paper/2605.16143","citing_paper":"/paper/2608.05987"},"observation_digest":"sha256:8131b465da6173042b2c9bf7977d0e9a13460fde4cde3017c9523ed400e5909b","observation_id":"fe176c02-ad4a-4efa-b45b-4c78bc7b7dff","resolution":{"observed_at":"2026-08-07T19:53:26.818924Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T19:53:25.959586Z","title":"arXiv preprint arXiv:2601.14050 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05987","last_updated":"2026-08-06T13:00:59Z","snapshot_observed_at":"2026-08-09T20:13:11.745301Z","submitted_at":"2026-08-06T13:00:59Z","title":"AgentOPSD: Recursive Self-Distillation for Agentic Reinforcement Learning","version":1},"reference_index":72,"source":"arxiv_source","source_observed_at":"2026-08-07T19:53:25.959586Z"},"links":{"citing_paper":"/paper/2608.05987"},"observation_digest":"sha256:68c6be02a95cb2b692f00d811c45f98803bff13821a26127451a9e80347b8d39","observation_id":"c41e9e68-7cc8-458d-8f78-953acbafccda","resolution":{"observed_at":"2026-08-07T19:53:25.959586Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.24846","last_updated":"2026-05-27T17:45:10Z","snapshot_observed_at":"2026-08-07T09:27:20.671708Z","submitted_at":"2026-05-24T03:31:07Z","title":"Tiny Brains, Giant Impact: Uncovering the Keystone Neurons of LLM with Just a Few Prompts","version":2},"cited_work":{"arxiv_id":"2605.24846","doi":null,"metadata_source":"pith","pith_arxiv_id":"2605.24846","snapshot_observed_at":"2026-08-07T19:53:26.497300Z","title":"Tiny Brains, Giant Impact: Uncovering the Keystone Neurons of LLM with Just a Few Prompts","venue":"cs.LG","work_id":"aa7e88ea-2bc4-4795-bb1d-a246ce66a57b","year":2026},"citing_paper":{"arxiv_id":"2608.05987","last_updated":"2026-08-06T13:00:59Z","snapshot_observed_at":"2026-08-09T20:13:11.745301Z","submitted_at":"2026-08-06T13:00:59Z","title":"AgentOPSD: Recursive Self-Distillation for Agentic Reinforcement Learning","version":1},"reference_index":73,"source":"arxiv_source","source_observed_at":"2026-08-07T19:53:25.999733Z"},"links":{"cited_paper":"/paper/2605.24846","citing_paper":"/paper/2608.05987"},"observation_digest":"sha256:52a84ca47fd6ddde7889750c93385aeb81ab9b4c93bf20901d68859e2c33f4b0","observation_id":"a1c9e453-598e-4be7-979c-de5c7e49473d","resolution":{"observed_at":"2026-08-07T19:53:26.507641Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.16153","last_updated":"2025-08-25T13:32:12Z","snapshot_observed_at":"2026-08-06T23:53:22.457977Z","submitted_at":"2025-08-22T07:25:30Z","title":"Memento: Fine-tuning LLM Agents without Fine-tuning LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.16153","snapshot_observed_at":"2026-08-07T19:53:26.038845Z","title":"arXiv preprint arXiv:2508.16153 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05987","last_updated":"2026-08-06T13:00:59Z","snapshot_observed_at":"2026-08-09T20:13:11.745301Z","submitted_at":"2026-08-06T13:00:59Z","title":"AgentOPSD: Recursive Self-Distillation for Agentic Reinforcement Learning","version":1},"reference_index":74,"source":"arxiv_source","source_observed_at":"2026-08-07T19:53:26.038845Z"},"links":{"cited_paper":"/paper/2508.16153","citing_paper":"/paper/2608.05987"},"observation_digest":"sha256:955c849092ce89eef11cada1a8a5799a909804f46d05acad9eb0bcb36d7560e0","observation_id":"81cb3325-a230-4c30-89de-3c6bf51209f1","resolution":{"observed_at":"2026-08-07T19:53:26.038845Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.04141","last_updated":"2025-05-29T08:04:32Z","snapshot_observed_at":"2026-07-06T20:02:08.313625Z","submitted_at":"2024-12-05T13:10:54Z","title":"Reducing Tool Hallucination via Reliability Alignment","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.04141","snapshot_observed_at":"2026-08-07T19:53:26.084902Z","title":"arXiv preprint arXiv:2412.04141 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05987","last_updated":"2026-08-06T13:00:59Z","snapshot_observed_at":"2026-08-09T20:13:11.745301Z","submitted_at":"2026-08-06T13:00:59Z","title":"AgentOPSD: Recursive Self-Distillation for Agentic Reinforcement Learning","version":1},"reference_index":75,"source":"arxiv_source","source_observed_at":"2026-08-07T19:53:26.084902Z"},"links":{"cited_paper":"/paper/2412.04141","citing_paper":"/paper/2608.05987"},"observation_digest":"sha256:72098e0c06d12c2117b6119c570a044b6e17a8dee308f8d1f3f3d2757f1fe60b","observation_id":"2972291e-fd12-47ea-83e2-d0fd5007ea01","resolution":{"observed_at":"2026-08-07T19:53:26.084902Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T19:53:26.141889Z","title":"Proceedings of the 2025 Conference on Empirical Methods in Natural Language Processing , pages=","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.05987","last_updated":"2026-08-06T13:00:59Z","snapshot_observed_at":"2026-08-09T20:13:11.745301Z","submitted_at":"2026-08-06T13:00:59Z","title":"AgentOPSD: Recursive Self-Distillation for Agentic Reinforcement Learning","version":1},"reference_index":76,"source":"arxiv_source","source_observed_at":"2026-08-07T19:53:26.141889Z"},"links":{"citing_paper":"/paper/2608.05987"},"observation_digest":"sha256:57c4e0305aa959733c1a47afb1a85e9321bd06218de81e1e4cbb006ee8213058","observation_id":"d28bd039-8e3e-45fc-a621-9b7d51d947a0","resolution":{"observed_at":"2026-08-07T19:53:26.141889Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T19:53:26.173725Z","title":"arXiv preprint arXiv:2509.11543 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05987","last_updated":"2026-08-06T13:00:59Z","snapshot_observed_at":"2026-08-09T20:13:11.745301Z","submitted_at":"2026-08-06T13:00:59Z","title":"AgentOPSD: Recursive Self-Distillation for Agentic Reinforcement Learning","version":1},"reference_index":77,"source":"arxiv_source","source_observed_at":"2026-08-07T19:53:26.173725Z"},"links":{"citing_paper":"/paper/2608.05987"},"observation_digest":"sha256:87adb5919f70286e79eb314351c6805a5e066e0f406c7c6ba012e66cc080f7b7","observation_id":"6f511aa7-b0b0-485b-993e-0790a83398b0","resolution":{"observed_at":"2026-08-07T19:53:26.173725Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2608.05987","last_updated":"2026-08-06T13:00:59Z","latest_version":1,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-09T20:13:11.745301Z","submitted_at":"2026-08-06T13:00:59Z","title":"AgentOPSD: Recursive Self-Distillation for Agentic Reinforcement Learning"},"reference_resolution":{"displayed":77,"state_counts":{"malformed_identifier":0,"metadata_mismatch":4,"parse_uncertain":0,"unresolved":58,"verified_exact":0,"verified_fuzzy":15},"total_outbound_references":77},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 77 of 77 outbound references and 0 inbound Pith citation observations for arXiv:2608.05987."}