{"as_of":"2026-08-17T17:13:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:25c8619d21ae22666c1cb100580ef1b862c29ce98df8fec5ce5282ccd173ea7c","coverage":[{"denominator":69,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":69,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T15:14:31.352194Z","state":"measured"},{"denominator":69,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":69,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-17T06:30:58.91139+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2608.09555/citation-record","integrity":"/paper/2608.09555/integrity","json":"/paper/2608.09555/citation-record.json","paper":"/paper/2608.09555"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:14:30.976180Z","title":"International Conference on Learning Representations , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09555","last_updated":"2026-08-10T12:53:06Z","snapshot_observed_at":"2026-08-16T22:34:20.426540Z","submitted_at":"2026-08-10T12:53:06Z","title":"Bidirectional Context Self-Distillation for Reinforcement Learning of Skill-Based LLM Agents","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-11T15:14:30.976180Z"},"links":{"citing_paper":"/paper/2608.09555"},"observation_digest":"sha256:c54779fc510eec43bee52d5f558c48cbf46d4878770e8064b93458ca33a8c5cb","observation_id":"507b7d8a-38a2-42b3-b2b6-0acf7a468d1a","resolution":{"observed_at":"2026-08-11T15:14:30.976180Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:14:30.980248Z","title":"2022 , url =","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.09555","last_updated":"2026-08-10T12:53:06Z","snapshot_observed_at":"2026-08-16T22:34:20.426540Z","submitted_at":"2026-08-10T12:53:06Z","title":"Bidirectional Context Self-Distillation for Reinforcement Learning of Skill-Based LLM Agents","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-11T15:14:30.980248Z"},"links":{"citing_paper":"/paper/2608.09555"},"observation_digest":"sha256:37a4932b61f5569d49bb00427042c6d0c948cbe1d0a342d9100324947d10fc61","observation_id":"ec0e4c63-4d3c-49c9-9246-db7a4424b54a","resolution":{"observed_at":"2026-08-11T15:14:30.980248Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:14:30.983543Z","title":"2017 , eprint =","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2608.09555","last_updated":"2026-08-10T12:53:06Z","snapshot_observed_at":"2026-08-16T22:34:20.426540Z","submitted_at":"2026-08-10T12:53:06Z","title":"Bidirectional Context Self-Distillation for Reinforcement Learning of Skill-Based LLM Agents","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-11T15:14:30.983543Z"},"links":{"citing_paper":"/paper/2608.09555"},"observation_digest":"sha256:5e0728523a27274e7fe293196821e405fcabab4d6650466a1aa3342f09160b3c","observation_id":"f414b360-34f2-4511-a4ab-4ad9c7342747","resolution":{"observed_at":"2026-08-11T15:14:30.983543Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:14:30.987646Z","title":"International Conference on Learning Representations , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09555","last_updated":"2026-08-10T12:53:06Z","snapshot_observed_at":"2026-08-16T22:34:20.426540Z","submitted_at":"2026-08-10T12:53:06Z","title":"Bidirectional Context Self-Distillation for Reinforcement Learning of Skill-Based LLM Agents","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-11T15:14:30.987646Z"},"links":{"citing_paper":"/paper/2608.09555"},"observation_digest":"sha256:142de1158df1be570e1be88de67b2b988c9316ad49545d0008d46b1bacf2ab75","observation_id":"9f3f7cbb-3c51-4871-9536-6cd3e0f3067a","resolution":{"observed_at":"2026-08-11T15:14:30.987646Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:14:32.154452Z","title":"2025 , url =","venue":null,"work_id":"f74ce2e4-876b-4138-a480-023321ea7335","year":2025},"citing_paper":{"arxiv_id":"2608.09555","last_updated":"2026-08-10T12:53:06Z","snapshot_observed_at":"2026-08-16T22:34:20.426540Z","submitted_at":"2026-08-10T12:53:06Z","title":"Bidirectional Context Self-Distillation for Reinforcement Learning of Skill-Based LLM Agents","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-11T15:14:30.996013Z"},"links":{"citing_paper":"/paper/2608.09555"},"observation_digest":"sha256:e4818c0441fea5b63b474b0276d518e1fbd00c70fffabece507cd62d6705000b","observation_id":"3efc714c-d80d-41c1-91f0-89e9c2ece75e","resolution":{"observed_at":"2026-08-11T15:14:32.157380Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:14:30.999591Z","title":"2025 , eprint =","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.09555","last_updated":"2026-08-10T12:53:06Z","snapshot_observed_at":"2026-08-16T22:34:20.426540Z","submitted_at":"2026-08-10T12:53:06Z","title":"Bidirectional Context Self-Distillation for Reinforcement Learning of Skill-Based LLM Agents","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-11T15:14:30.999591Z"},"links":{"citing_paper":"/paper/2608.09555"},"observation_digest":"sha256:043cf2457b41b0741f02f3715d5db4b1eb2020fd0093b2424269909533bea38c","observation_id":"b4e1fdf8-05e5-4121-bce1-fb5acde55492","resolution":{"observed_at":"2026-08-11T15:14:30.999591Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:14:31.003152Z","title":"2023 , url =","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.09555","last_updated":"2026-08-10T12:53:06Z","snapshot_observed_at":"2026-08-16T22:34:20.426540Z","submitted_at":"2026-08-10T12:53:06Z","title":"Bidirectional Context Self-Distillation for Reinforcement Learning of Skill-Based LLM Agents","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-11T15:14:31.003152Z"},"links":{"citing_paper":"/paper/2608.09555"},"observation_digest":"sha256:a1b2bbbfa744e86887d5acfa93cf9830552aad5906169a385018153cea7112be","observation_id":"92734b7a-db07-4d6d-9659-552b77650e4b","resolution":{"observed_at":"2026-08-11T15:14:31.003152Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:14:31.006428Z","title":"International Conference on Learning Representations , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09555","last_updated":"2026-08-10T12:53:06Z","snapshot_observed_at":"2026-08-16T22:34:20.426540Z","submitted_at":"2026-08-10T12:53:06Z","title":"Bidirectional Context Self-Distillation for Reinforcement Learning of Skill-Based LLM Agents","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-11T15:14:31.006428Z"},"links":{"citing_paper":"/paper/2608.09555"},"observation_digest":"sha256:b501d65c26c47974b7859530ee5db3fa0c67f3a92166fb2743c7b300ebd6f384","observation_id":"3bece669-2d40-414f-bb49-228eee50de32","resolution":{"observed_at":"2026-08-11T15:14:31.006428Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:14:32.125441Z","title":"International Conference on Learning Representations (ICLR) , year =","venue":null,"work_id":"6dd7d507-91c2-48dd-b764-92628549460e","year":null},"citing_paper":{"arxiv_id":"2608.09555","last_updated":"2026-08-10T12:53:06Z","snapshot_observed_at":"2026-08-16T22:34:20.426540Z","submitted_at":"2026-08-10T12:53:06Z","title":"Bidirectional Context Self-Distillation for Reinforcement Learning of Skill-Based LLM Agents","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-11T15:14:31.010594Z"},"links":{"citing_paper":"/paper/2608.09555"},"observation_digest":"sha256:1002aa300c8ba80d2d343b026412756958f72dd329435b8ff554760af7bbca2e","observation_id":"99017870-c196-4656-8f59-c359729bf9e7","resolution":{"observed_at":"2026-08-11T15:14:32.129503Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:14:32.115382Z","title":"Second Conference on Language Modeling , year =","venue":null,"work_id":"533b821a-2b10-4163-8941-abb611f7ee4d","year":null},"citing_paper":{"arxiv_id":"2608.09555","last_updated":"2026-08-10T12:53:06Z","snapshot_observed_at":"2026-08-16T22:34:20.426540Z","submitted_at":"2026-08-10T12:53:06Z","title":"Bidirectional Context Self-Distillation for Reinforcement Learning of Skill-Based LLM Agents","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-11T15:14:31.015953Z"},"links":{"citing_paper":"/paper/2608.09555"},"observation_digest":"sha256:d054cdc5a29ac2853a3660c5ac50c9d8ef4c0d1ddf6ef6c1491c3ce5af20d995","observation_id":"e40c3af5-00e0-48ec-bc7a-d4b0a9fe2f33","resolution":{"observed_at":"2026-08-11T15:14:32.118597Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:14:32.106066Z","title":"2026 , eprint =","venue":null,"work_id":"0bc80631-65f7-4c9d-805d-c7d545b3723d","year":2026},"citing_paper":{"arxiv_id":"2608.09555","last_updated":"2026-08-10T12:53:06Z","snapshot_observed_at":"2026-08-16T22:34:20.426540Z","submitted_at":"2026-08-10T12:53:06Z","title":"Bidirectional Context Self-Distillation for Reinforcement Learning of Skill-Based LLM Agents","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-11T15:14:31.020099Z"},"links":{"citing_paper":"/paper/2608.09555"},"observation_digest":"sha256:4b3e08b6f8bd6aaa742768a278b53ab131470f48e5c670aabd45b3e4c4532024","observation_id":"6dd801f0-3f9e-4817-8d7e-3e1cfa13d9cb","resolution":{"observed_at":"2026-08-11T15:14:32.109156Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:14:31.054296Z","title":"2026 , eprint =","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.09555","last_updated":"2026-08-10T12:53:06Z","snapshot_observed_at":"2026-08-16T22:34:20.426540Z","submitted_at":"2026-08-10T12:53:06Z","title":"Bidirectional Context Self-Distillation for Reinforcement Learning of Skill-Based LLM Agents","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-11T15:14:31.054296Z"},"links":{"citing_paper":"/paper/2608.09555"},"observation_digest":"sha256:1e696c940e68c86d43db6bd5fa20db14e161d842601371a450cc2c16b84efc96","observation_id":"735f970c-752e-4b13-9537-801c6497fb0e","resolution":{"observed_at":"2026-08-11T15:14:31.054296Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.11853","last_updated":"2026-05-14T10:19:32Z","snapshot_observed_at":"2026-08-14T20:01:38.086441Z","submitted_at":"2026-05-12T09:38:38Z","title":"GEAR: Granularity-Adaptive Advantage Reweighting for LLM Agents via Self-Distillation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.11853","snapshot_observed_at":"2026-08-11T15:14:31.058179Z","title":"2605.11853 , archivePrefix =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09555","last_updated":"2026-08-10T12:53:06Z","snapshot_observed_at":"2026-08-16T22:34:20.426540Z","submitted_at":"2026-08-10T12:53:06Z","title":"Bidirectional Context Self-Distillation for Reinforcement Learning of Skill-Based LLM Agents","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-11T15:14:31.058179Z"},"links":{"cited_paper":"/paper/2605.11853","citing_paper":"/paper/2608.09555"},"observation_digest":"sha256:440d2367e36d684e95e34e652d404f15d8e9b3361b9e6ca092e15844fcabf24d","observation_id":"d178ae83-6349-47c7-9064-aaad55c6bdf3","resolution":{"observed_at":"2026-08-11T15:14:31.058179Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:14:32.089118Z","title":"2023 , url =","venue":null,"work_id":"c47314ec-9eab-463e-baf5-9735e3277513","year":2023},"citing_paper":{"arxiv_id":"2608.09555","last_updated":"2026-08-10T12:53:06Z","snapshot_observed_at":"2026-08-16T22:34:20.426540Z","submitted_at":"2026-08-10T12:53:06Z","title":"Bidirectional Context Self-Distillation for Reinforcement Learning of Skill-Based LLM Agents","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-11T15:14:31.073931Z"},"links":{"citing_paper":"/paper/2608.09555"},"observation_digest":"sha256:3d517012f2a1fa511d4b4b3c92f5e956505156981c6dde9b2eb987c42f66e0fb","observation_id":"77e13218-f9ee-42fb-94a6-63aad1b95416","resolution":{"observed_at":"2026-08-11T15:14:32.092993Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:14:32.078645Z","title":"2026 , month = may, eprint =","venue":null,"work_id":"9968a327-5adc-40a4-9b66-22850e1e728c","year":2026},"citing_paper":{"arxiv_id":"2608.09555","last_updated":"2026-08-10T12:53:06Z","snapshot_observed_at":"2026-08-16T22:34:20.426540Z","submitted_at":"2026-08-10T12:53:06Z","title":"Bidirectional Context Self-Distillation for Reinforcement Learning of Skill-Based LLM Agents","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-11T15:14:31.078010Z"},"links":{"citing_paper":"/paper/2608.09555"},"observation_digest":"sha256:7c137089510836aa6ac0c83e3b6c3f3ddcbfdeae94bbc297bd0d2de02d970b1c","observation_id":"ea3cc6d0-a8f2-415a-8700-49c02817f0e3","resolution":{"observed_at":"2026-08-11T15:14:32.082071Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:14:32.067932Z","title":"Proceedings of the 43rd International Conference on Machine Learning , volume =","venue":null,"work_id":"75548c63-1312-45c0-adcc-018ddbc23d86","year":2026},"citing_paper":{"arxiv_id":"2608.09555","last_updated":"2026-08-10T12:53:06Z","snapshot_observed_at":"2026-08-16T22:34:20.426540Z","submitted_at":"2026-08-10T12:53:06Z","title":"Bidirectional Context Self-Distillation for Reinforcement Learning of Skill-Based LLM Agents","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-11T15:14:31.093811Z"},"links":{"citing_paper":"/paper/2608.09555"},"observation_digest":"sha256:23c7928b01ca774d52dad431d271e3fca0c137d7f0a321d4484074a3d73fb394","observation_id":"afb1506b-0360-48a2-b815-4fcbb778c4b2","resolution":{"observed_at":"2026-08-11T15:14:32.071353Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:14:32.057257Z","title":"Proceedings of the 43rd International Conference on Machine Learning , volume =","venue":null,"work_id":"1ccc88b0-bf30-4b9f-ab40-0763fdcb950a","year":2026},"citing_paper":{"arxiv_id":"2608.09555","last_updated":"2026-08-10T12:53:06Z","snapshot_observed_at":"2026-08-16T22:34:20.426540Z","submitted_at":"2026-08-10T12:53:06Z","title":"Bidirectional Context Self-Distillation for Reinforcement Learning of Skill-Based LLM Agents","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-11T15:14:31.099335Z"},"links":{"citing_paper":"/paper/2608.09555"},"observation_digest":"sha256:05a04caf2d64ed943f0e246401089637d7a0acab35a3463521691408e5faadfc","observation_id":"9625b209-5e08-4a6b-9e98-aa3ff18ffc87","resolution":{"observed_at":"2026-08-11T15:14:32.060992Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:14:31.125179Z","title":"Advances in neural information processing systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09555","last_updated":"2026-08-10T12:53:06Z","snapshot_observed_at":"2026-08-16T22:34:20.426540Z","submitted_at":"2026-08-10T12:53:06Z","title":"Bidirectional Context Self-Distillation for Reinforcement Learning of Skill-Based LLM Agents","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-11T15:14:31.125179Z"},"links":{"citing_paper":"/paper/2608.09555"},"observation_digest":"sha256:327e2167a7864760f4e4f15170ad90daa8d2127a179d019ff234988e0830a522","observation_id":"ec4464c1-269d-46b5-87f9-ef545c6507cb","resolution":{"observed_at":"2026-08-11T15:14:31.125179Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:14:31.139246Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09555","last_updated":"2026-08-10T12:53:06Z","snapshot_observed_at":"2026-08-16T22:34:20.426540Z","submitted_at":"2026-08-10T12:53:06Z","title":"Bidirectional Context Self-Distillation for Reinforcement Learning of Skill-Based LLM Agents","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-11T15:14:31.139246Z"},"links":{"citing_paper":"/paper/2608.09555"},"observation_digest":"sha256:fb436ebde22d153da71f8f65340d1a7c20ac2290f4b5eae04adbece4d0355b15","observation_id":"c3291273-6664-455b-8734-e00f2be9b645","resolution":{"observed_at":"2026-08-11T15:14:31.139246Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:14:32.021801Z","title":"Forty-third International Conference on Machine Learning , year=","venue":null,"work_id":"a8c05843-f3c5-4fbe-97d4-5bd6c241a666","year":null},"citing_paper":{"arxiv_id":"2608.09555","last_updated":"2026-08-10T12:53:06Z","snapshot_observed_at":"2026-08-16T22:34:20.426540Z","submitted_at":"2026-08-10T12:53:06Z","title":"Bidirectional Context Self-Distillation for Reinforcement Learning of Skill-Based LLM Agents","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-11T15:14:31.142247Z"},"links":{"citing_paper":"/paper/2608.09555"},"observation_digest":"sha256:e62274fbdee33dc9b070e454cabe645854ef97fb8e7591bca87d9327cd22a9df","observation_id":"2fadadc6-3f06-4d56-bdb6-f4c7f8fafa4a","resolution":{"observed_at":"2026-08-11T15:14:32.026672Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:14:32.010590Z","title":"Findings of the Association for Computational Linguistics: EACL 2026 , pages=","venue":null,"work_id":"d3554620-e5a4-41d1-abf5-6ed812c18d1a","year":2026},"citing_paper":{"arxiv_id":"2608.09555","last_updated":"2026-08-10T12:53:06Z","snapshot_observed_at":"2026-08-16T22:34:20.426540Z","submitted_at":"2026-08-10T12:53:06Z","title":"Bidirectional Context Self-Distillation for Reinforcement Learning of Skill-Based LLM Agents","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-11T15:14:31.145122Z"},"links":{"citing_paper":"/paper/2608.09555"},"observation_digest":"sha256:a21f3fef39733171e48384f1ce4db243dd9d9cae5713d118fff7755d9368dab9","observation_id":"94c8467a-5574-4b64-b110-113fa04877b1","resolution":{"observed_at":"2026-08-11T15:14:32.014141Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:14:31.998612Z","title":"Findings of the Association for Computational Linguistics: EACL 2026 , pages=","venue":null,"work_id":"8c6b0f06-0542-457c-a9fd-8d570b7547c4","year":2026},"citing_paper":{"arxiv_id":"2608.09555","last_updated":"2026-08-10T12:53:06Z","snapshot_observed_at":"2026-08-16T22:34:20.426540Z","submitted_at":"2026-08-10T12:53:06Z","title":"Bidirectional Context Self-Distillation for Reinforcement Learning of Skill-Based LLM Agents","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-11T15:14:31.162221Z"},"links":{"citing_paper":"/paper/2608.09555"},"observation_digest":"sha256:1aa9d77f173e8e0fe89605eebc23293c9058aa4ca36ec454ba6d102dc3b91b5a","observation_id":"e3d8046d-db4a-4506-925d-baf8001abceb","resolution":{"observed_at":"2026-08-11T15:14:32.003465Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:14:31.988564Z","title":null,"venue":null,"work_id":"2f135faa-4366-402c-8358-4f34498354a6","year":null},"citing_paper":{"arxiv_id":"2608.09555","last_updated":"2026-08-10T12:53:06Z","snapshot_observed_at":"2026-08-16T22:34:20.426540Z","submitted_at":"2026-08-10T12:53:06Z","title":"Bidirectional Context Self-Distillation for Reinforcement Learning of Skill-Based LLM Agents","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-11T15:14:31.173862Z"},"links":{"citing_paper":"/paper/2608.09555"},"observation_digest":"sha256:ce68668efaa3089aabad248771655244481b57a29ae729d92bc64e03a4312936","observation_id":"c2e3fe46-1ea6-4bd7-a256-7a6315a69c4d","resolution":{"observed_at":"2026-08-11T15:14:31.992407Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:14:31.177934Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09555","last_updated":"2026-08-10T12:53:06Z","snapshot_observed_at":"2026-08-16T22:34:20.426540Z","submitted_at":"2026-08-10T12:53:06Z","title":"Bidirectional Context Self-Distillation for Reinforcement Learning of Skill-Based LLM Agents","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-11T15:14:31.177934Z"},"links":{"citing_paper":"/paper/2608.09555"},"observation_digest":"sha256:fa61608786c9051a0aeef33591ad581a699ca3262db46f90bb37791789f5547b","observation_id":"0fb8bede-4e9f-4bf5-80ef-f88c3eefe78c","resolution":{"observed_at":"2026-08-11T15:14:31.177934Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:14:31.968894Z","title":null,"venue":null,"work_id":"11a3c55f-d981-4fdb-aa43-fb38e0e9acce","year":2024},"citing_paper":{"arxiv_id":"2608.09555","last_updated":"2026-08-10T12:53:06Z","snapshot_observed_at":"2026-08-16T22:34:20.426540Z","submitted_at":"2026-08-10T12:53:06Z","title":"Bidirectional Context Self-Distillation for Reinforcement Learning of Skill-Based LLM Agents","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-11T15:14:31.183855Z"},"links":{"citing_paper":"/paper/2608.09555"},"observation_digest":"sha256:910e293a71f75d5402923da31e8010c4ee1a253c6eb4ddc8fe1a3be4e163b5e2","observation_id":"b1f247c1-3cb1-4910-83e1-40bf05a79537","resolution":{"observed_at":"2026-08-11T15:14:31.973251Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.01600","last_updated":"2025-03-08T05:23:57Z","snapshot_observed_at":"2026-08-17T11:46:18.694788Z","submitted_at":"2025-02-03T18:35:42Z","title":"Reinforcement Learning for Long-Horizon Interactive LLM Agents","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.01600","snapshot_observed_at":"2026-08-11T15:14:31.186850Z","title":"a henb \\","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.09555","last_updated":"2026-08-10T12:53:06Z","snapshot_observed_at":"2026-08-16T22:34:20.426540Z","submitted_at":"2026-08-10T12:53:06Z","title":"Bidirectional Context Self-Distillation for Reinforcement Learning of Skill-Based LLM Agents","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-11T15:14:31.186850Z"},"links":{"cited_paper":"/paper/2502.01600","citing_paper":"/paper/2608.09555"},"observation_digest":"sha256:5174b29c41afc27a0a8bec5b8603e2b94eeb3ae0017632419e29020684f4e1e3","observation_id":"7903429c-8806-47f5-980f-186ef96cb48c","resolution":{"observed_at":"2026-08-11T15:14:31.186850Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:14:31.189966Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.09555","last_updated":"2026-08-10T12:53:06Z","snapshot_observed_at":"2026-08-16T22:34:20.426540Z","submitted_at":"2026-08-10T12:53:06Z","title":"Bidirectional Context Self-Distillation for Reinforcement Learning of Skill-Based LLM Agents","version":1},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-11T15:14:31.189966Z"},"links":{"citing_paper":"/paper/2608.09555"},"observation_digest":"sha256:df9cbecbfbfbeb558ef40db0d3b61ab222073258a24eed1addc3c36bf4e7b63f","observation_id":"4593b1e1-e865-42c5-80b1-38575037517d","resolution":{"observed_at":"2026-08-11T15:14:31.189966Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:14:31.193019Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.09555","last_updated":"2026-08-10T12:53:06Z","snapshot_observed_at":"2026-08-16T22:34:20.426540Z","submitted_at":"2026-08-10T12:53:06Z","title":"Bidirectional Context Self-Distillation for Reinforcement Learning of Skill-Based LLM Agents","version":1},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-11T15:14:31.193019Z"},"links":{"citing_paper":"/paper/2608.09555"},"observation_digest":"sha256:85a316c981450d282d91d72eb033648640b9684219e24771c5495880368ca620","observation_id":"9f45d545-e925-4af2-bfa7-27ec2a10c16d","resolution":{"observed_at":"2026-08-11T15:14:31.193019Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:14:31.949925Z","title":null,"venue":null,"work_id":"5a7deec5-76e2-491f-b94d-c2b157abca4f","year":2026},"citing_paper":{"arxiv_id":"2608.09555","last_updated":"2026-08-10T12:53:06Z","snapshot_observed_at":"2026-08-16T22:34:20.426540Z","submitted_at":"2026-08-10T12:53:06Z","title":"Bidirectional Context Self-Distillation for Reinforcement Learning of Skill-Based LLM Agents","version":1},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-11T15:14:31.196233Z"},"links":{"citing_paper":"/paper/2608.09555"},"observation_digest":"sha256:538d3273c3120f9daa93f22848469e8aeb9d1290b7ae8a4290c3f1b8b2e52a53","observation_id":"71d40a3b-ce9c-42d6-80d4-a5be85594e34","resolution":{"observed_at":"2026-08-11T15:14:31.953664Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-08-15T12:33:55.451951Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-11T15:14:31.199401Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.09555","last_updated":"2026-08-10T12:53:06Z","snapshot_observed_at":"2026-08-16T22:34:20.426540Z","submitted_at":"2026-08-10T12:53:06Z","title":"Bidirectional Context Self-Distillation for Reinforcement Learning of Skill-Based LLM Agents","version":1},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-11T15:14:31.199401Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2608.09555"},"observation_digest":"sha256:cea758339dd2d050aa10cae9294fe5204d10e58cfca68ed0007bfef91df96ff0","observation_id":"6fa0560f-0a04-4218-8b47-06a2655faad2","resolution":{"observed_at":"2026-08-11T15:14:31.199401Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2606.02355","last_updated":"2026-06-01T15:02:59Z","snapshot_observed_at":"2026-08-16T00:03:12.293319Z","submitted_at":"2026-06-01T15:02:59Z","title":"SIRI: Self-Internalizing Reinforcement Learning with Intrinsic Skills for LLM Agent Training","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2606.02355","snapshot_observed_at":"2026-08-11T15:14:31.203282Z","title":"H.; Liu, X.; Wei, L.; Pan, L.; Zeng, K.; and Cai, X","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.09555","last_updated":"2026-08-10T12:53:06Z","snapshot_observed_at":"2026-08-16T22:34:20.426540Z","submitted_at":"2026-08-10T12:53:06Z","title":"Bidirectional Context Self-Distillation for Reinforcement Learning of Skill-Based LLM Agents","version":1},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-11T15:14:31.203282Z"},"links":{"cited_paper":"/paper/2606.02355","citing_paper":"/paper/2608.09555"},"observation_digest":"sha256:f27e1876eeed773e0b677493aed284f769cbd3e7d3dfcb745210c3baa6f5165b","observation_id":"ba50a996-3829-4f31-aa03-7ad9e382394e","resolution":{"observed_at":"2026-08-11T15:14:31.203282Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:14:31.937775Z","title":"u botter, J.; L \\","venue":null,"work_id":"63eb5473-b4ff-4dba-ba43-61f067948d9d","year":2026},"citing_paper":{"arxiv_id":"2608.09555","last_updated":"2026-08-10T12:53:06Z","snapshot_observed_at":"2026-08-16T22:34:20.426540Z","submitted_at":"2026-08-10T12:53:06Z","title":"Bidirectional Context Self-Distillation for Reinforcement Learning of Skill-Based LLM Agents","version":1},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-08-11T15:14:31.207650Z"},"links":{"citing_paper":"/paper/2608.09555"},"observation_digest":"sha256:6e473623e4dbf21b77d47345784539b7c15f7055bdac6be7b227f85a4d8902cb","observation_id":"1a5adf60-4924-4522-bbdc-8762f73a4f17","resolution":{"observed_at":"2026-08-11T15:14:31.941921Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2602.20867","last_updated":"2026-02-24T13:11:38Z","snapshot_observed_at":"2026-08-14T19:45:58.327526Z","submitted_at":"2026-02-24T13:11:38Z","title":"SoK: Agentic Skills -- Beyond Tool Use in LLM Agents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2602.20867","snapshot_observed_at":"2026-08-11T15:14:31.212116Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.09555","last_updated":"2026-08-10T12:53:06Z","snapshot_observed_at":"2026-08-16T22:34:20.426540Z","submitted_at":"2026-08-10T12:53:06Z","title":"Bidirectional Context Self-Distillation for Reinforcement Learning of Skill-Based LLM Agents","version":1},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-08-11T15:14:31.212116Z"},"links":{"cited_paper":"/paper/2602.20867","citing_paper":"/paper/2608.09555"},"observation_digest":"sha256:fcd7c58d7aff3edf3b3c15511f642a7a7568e1e2fe198f7f3db35f0f8b4ee5b9","observation_id":"332ac8d8-a995-4f21-9355-a4f861712fe7","resolution":{"observed_at":"2026-08-11T15:14:31.212116Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.23493","last_updated":"2026-05-22T10:55:15Z","snapshot_observed_at":"2026-08-06T03:34:33.212532Z","submitted_at":"2026-05-22T10:55:15Z","title":"EDGE-OPD: Internalizing Privileged Context with Evidence Guided On-Policy Distillation","version":1},"cited_work":{"arxiv_id":"2605.23493","doi":null,"metadata_source":"pith","pith_arxiv_id":"2605.23493","snapshot_observed_at":"2026-08-11T15:14:31.549613Z","title":"EDGE-OPD: Internalizing Privileged Context with Evidence Guided On-Policy Distillation","venue":"cs.AI","work_id":"28f1b8aa-be82-4da4-abee-905a7325fbea","year":2026},"citing_paper":{"arxiv_id":"2608.09555","last_updated":"2026-08-10T12:53:06Z","snapshot_observed_at":"2026-08-16T22:34:20.426540Z","submitted_at":"2026-08-10T12:53:06Z","title":"Bidirectional Context Self-Distillation for Reinforcement Learning of Skill-Based LLM Agents","version":1},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-08-11T15:14:31.217336Z"},"links":{"cited_paper":"/paper/2605.23493","citing_paper":"/paper/2608.09555"},"observation_digest":"sha256:df3232a0bcb70009668057c29d2c16cdfee7e39d75283081e78db54e579877a5","observation_id":"2aab8971-1b3e-4fcf-8d37-b6971394b381","resolution":{"observed_at":"2026-08-11T15:14:31.556314Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:14:31.925171Z","title":null,"venue":null,"work_id":"1967d289-f44e-4945-8f29-aa6ad7caf916","year":2026},"citing_paper":{"arxiv_id":"2608.09555","last_updated":"2026-08-10T12:53:06Z","snapshot_observed_at":"2026-08-16T22:34:20.426540Z","submitted_at":"2026-08-10T12:53:06Z","title":"Bidirectional Context Self-Distillation for Reinforcement Learning of Skill-Based LLM Agents","version":1},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-08-11T15:14:31.221025Z"},"links":{"citing_paper":"/paper/2608.09555"},"observation_digest":"sha256:e526545f5d4dd634dd75ffa3ab558ff12109cbbe603f8bf92975eda6724b5507","observation_id":"ebec9a3e-062a-4e55-a20f-6ed588e00157","resolution":{"observed_at":"2026-08-11T15:14:31.929641Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:14:31.915203Z","title":"P.; Li, L.; and Li, Y","venue":null,"work_id":"77976229-1f6b-4a94-9680-8b2e2a9519e9","year":2026},"citing_paper":{"arxiv_id":"2608.09555","last_updated":"2026-08-10T12:53:06Z","snapshot_observed_at":"2026-08-16T22:34:20.426540Z","submitted_at":"2026-08-10T12:53:06Z","title":"Bidirectional Context Self-Distillation for Reinforcement Learning of Skill-Based LLM Agents","version":1},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-08-11T15:14:31.225101Z"},"links":{"citing_paper":"/paper/2608.09555"},"observation_digest":"sha256:3ffc997d5e93a65e5ec0c2ec4f4edf684c2890f5f90e927b38bf978e6b9f3971","observation_id":"7609e894-bf27-43ad-9b10-a3b69843474f","resolution":{"observed_at":"2026-08-11T15:14:31.918665Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2602.12670","last_updated":"2026-03-13T07:33:01Z","snapshot_observed_at":"2026-08-12T09:12:28.700231Z","submitted_at":"2026-02-13T07:06:06Z","title":"SkillsBench: Benchmarking How Well Agent Skills Work Across Diverse Tasks","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2602.12670","snapshot_observed_at":"2026-08-11T15:14:31.229838Z","title":"W.; Sun, J.; Wang, S.; et al","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.09555","last_updated":"2026-08-10T12:53:06Z","snapshot_observed_at":"2026-08-16T22:34:20.426540Z","submitted_at":"2026-08-10T12:53:06Z","title":"Bidirectional Context Self-Distillation for Reinforcement Learning of Skill-Based LLM Agents","version":1},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-08-11T15:14:31.229838Z"},"links":{"cited_paper":"/paper/2602.12670","citing_paper":"/paper/2608.09555"},"observation_digest":"sha256:296c82552c1241e430f26dba9d7c08d7b70f3ecca03a34c6f61cb07e09978110","observation_id":"503145b6-beff-4139-ba22-c6a09da9dca3","resolution":{"observed_at":"2026-08-11T15:14:31.229838Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2606.08671","last_updated":"2026-07-06T18:50:16Z","snapshot_observed_at":"2026-08-14T21:01:20.738645Z","submitted_at":"2026-06-07T15:21:08Z","title":"SkillHone: A Harness for Continual Agent Skill Evolution Through Persistent Decision History","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2606.08671","snapshot_observed_at":"2026-08-11T15:14:31.233000Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.09555","last_updated":"2026-08-10T12:53:06Z","snapshot_observed_at":"2026-08-16T22:34:20.426540Z","submitted_at":"2026-08-10T12:53:06Z","title":"Bidirectional Context Self-Distillation for Reinforcement Learning of Skill-Based LLM Agents","version":1},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-08-11T15:14:31.233000Z"},"links":{"cited_paper":"/paper/2606.08671","citing_paper":"/paper/2608.09555"},"observation_digest":"sha256:8d89cb994a6ac92ef0148ce04fb61254b26651a6baa06b4b505e23d02bb62f0c","observation_id":"6a4ff8dd-f86f-4355-890f-0676403ec2fb","resolution":{"observed_at":"2026-08-11T15:14:31.233000Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2606.11559","last_updated":"2026-06-10T01:35:34Z","snapshot_observed_at":"2026-08-13T12:14:59.791076Z","submitted_at":"2026-06-10T01:35:34Z","title":"HERO: Hindsight-Enhanced Reflection from Environment Observations for Agentic Self-Distillation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2606.11559","snapshot_observed_at":"2026-08-11T15:14:31.236567Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.09555","last_updated":"2026-08-10T12:53:06Z","snapshot_observed_at":"2026-08-16T22:34:20.426540Z","submitted_at":"2026-08-10T12:53:06Z","title":"Bidirectional Context Self-Distillation for Reinforcement Learning of Skill-Based LLM Agents","version":1},"reference_index":67,"source":"arxiv_source","source_observed_at":"2026-08-11T15:14:31.236567Z"},"links":{"cited_paper":"/paper/2606.11559","citing_paper":"/paper/2608.09555"},"observation_digest":"sha256:2151740e5e403909314b0297d95776fe1cb4c287edb040c7c8f77f0e8ef539ac","observation_id":"b2730c46-5290-4f27-89a8-d2e32580b505","resolution":{"observed_at":"2026-08-11T15:14:31.236567Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.04323","last_updated":"2026-04-06T00:10:30Z","snapshot_observed_at":"2026-08-16T08:11:33.517788Z","submitted_at":"2026-04-06T00:10:30Z","title":"How Well Do Agentic Skills Work in the Wild: Benchmarking LLM Skill Usage in Realistic Settings","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.04323","snapshot_observed_at":"2026-08-11T15:14:31.241692Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.09555","last_updated":"2026-08-10T12:53:06Z","snapshot_observed_at":"2026-08-16T22:34:20.426540Z","submitted_at":"2026-08-10T12:53:06Z","title":"Bidirectional Context Self-Distillation for Reinforcement Learning of Skill-Based LLM Agents","version":1},"reference_index":68,"source":"arxiv_source","source_observed_at":"2026-08-11T15:14:31.241692Z"},"links":{"cited_paper":"/paper/2604.04323","citing_paper":"/paper/2608.09555"},"observation_digest":"sha256:df8296d03f1d3d1dfc13b41749bb6565204d81504b5c42a497bc0e8b6dcabc93","observation_id":"f0c112e7-467d-4bfd-ba97-f50e376d4d6d","resolution":{"observed_at":"2026-08-11T15:14:31.241692Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.15155","last_updated":"2026-05-14T17:51:26Z","snapshot_observed_at":"2026-08-16T20:35:48.643273Z","submitted_at":"2026-05-14T17:51:26Z","title":"Self-Distilled Agentic Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.15155","snapshot_observed_at":"2026-08-11T15:14:31.246337Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.09555","last_updated":"2026-08-10T12:53:06Z","snapshot_observed_at":"2026-08-16T22:34:20.426540Z","submitted_at":"2026-08-10T12:53:06Z","title":"Bidirectional Context Self-Distillation for Reinforcement Learning of Skill-Based LLM Agents","version":1},"reference_index":69,"source":"arxiv_source","source_observed_at":"2026-08-11T15:14:31.246337Z"},"links":{"cited_paper":"/paper/2605.15155","citing_paper":"/paper/2608.09555"},"observation_digest":"sha256:4af1bf5f0eb74953299cc7acf1856196820c439d30da7700581bf74cfc79732e","observation_id":"6bc7b0b5-192d-4e4c-bbdf-54a7ffb1cbc1","resolution":{"observed_at":"2026-08-11T15:14:31.246337Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2606.30406","last_updated":"2026-06-29T14:51:28Z","snapshot_observed_at":"2026-08-10T09:37:40.339025Z","submitted_at":"2026-06-29T14:51:28Z","title":"MOPD: Multi-Teacher On-Policy Distillation for Capability Integration in LLM Post-Training","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2606.30406","snapshot_observed_at":"2026-08-11T15:14:31.251390Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.09555","last_updated":"2026-08-10T12:53:06Z","snapshot_observed_at":"2026-08-16T22:34:20.426540Z","submitted_at":"2026-08-10T12:53:06Z","title":"Bidirectional Context Self-Distillation for Reinforcement Learning of Skill-Based LLM Agents","version":1},"reference_index":70,"source":"arxiv_source","source_observed_at":"2026-08-11T15:14:31.251390Z"},"links":{"cited_paper":"/paper/2606.30406","citing_paper":"/paper/2608.09555"},"observation_digest":"sha256:b9d75d9d4d3556b7ff30184385e004806db3b0b8d23f4774f56f6c02104ae55d","observation_id":"5921ee81-82c8-4cdc-b881-177b858037a4","resolution":{"observed_at":"2026-08-11T15:14:31.251390Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.08377","last_updated":"2026-08-10T11:40:00Z","snapshot_observed_at":"2026-08-13T23:38:44.225146Z","submitted_at":"2026-04-09T15:38:27Z","title":"SkillClaw: Let Skills Evolve Collectively with Agentic Evolver","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.08377","snapshot_observed_at":"2026-08-11T15:14:31.255877Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.09555","last_updated":"2026-08-10T12:53:06Z","snapshot_observed_at":"2026-08-16T22:34:20.426540Z","submitted_at":"2026-08-10T12:53:06Z","title":"Bidirectional Context Self-Distillation for Reinforcement Learning of Skill-Based LLM Agents","version":1},"reference_index":71,"source":"arxiv_source","source_observed_at":"2026-08-11T15:14:31.255877Z"},"links":{"cited_paper":"/paper/2604.08377","citing_paper":"/paper/2608.09555"},"observation_digest":"sha256:e74577a06ab7d40951ee7102f4e7dee4e1355d79e23ad813403bcc6b0c3acb34","observation_id":"acaa1adb-a251-4f1e-9c7a-a594570efc28","resolution":{"observed_at":"2026-08-11T15:14:31.255877Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2603.25158","last_updated":"2026-06-04T12:51:52Z","snapshot_observed_at":"2026-08-12T22:20:59.543657Z","submitted_at":"2026-03-26T08:26:38Z","title":"Trace2Skill: Distill Trajectory-Local Lessons into Transferable Agent Skills","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2603.25158","snapshot_observed_at":"2026-08-11T15:14:31.259533Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.09555","last_updated":"2026-08-10T12:53:06Z","snapshot_observed_at":"2026-08-16T22:34:20.426540Z","submitted_at":"2026-08-10T12:53:06Z","title":"Bidirectional Context Self-Distillation for Reinforcement Learning of Skill-Based LLM Agents","version":1},"reference_index":72,"source":"arxiv_source","source_observed_at":"2026-08-11T15:14:31.259533Z"},"links":{"cited_paper":"/paper/2603.25158","citing_paper":"/paper/2608.09555"},"observation_digest":"sha256:cd45205314e093d4f092455a5c1d98c04b19ff487edb529c526694ca795b4bb2","observation_id":"2fd1d420-36c9-458a-b1cc-3269af44cfce","resolution":{"observed_at":"2026-08-11T15:14:31.259533Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:14:31.264307Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.09555","last_updated":"2026-08-10T12:53:06Z","snapshot_observed_at":"2026-08-16T22:34:20.426540Z","submitted_at":"2026-08-10T12:53:06Z","title":"Bidirectional Context Self-Distillation for Reinforcement Learning of Skill-Based LLM Agents","version":1},"reference_index":73,"source":"arxiv_source","source_observed_at":"2026-08-11T15:14:31.264307Z"},"links":{"citing_paper":"/paper/2608.09555"},"observation_digest":"sha256:821aa1648acd76942773d1983aa3fa3d72bd79542024001d859ed38af58a42ec","observation_id":"cc3f5913-16a2-4ea7-bcb1-91dc3ab8e900","resolution":{"observed_at":"2026-08-11T15:14:31.264307Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2606.11709","last_updated":"2026-06-10T06:31:59Z","snapshot_observed_at":"2026-08-16T02:55:53.932381Z","submitted_at":"2026-06-10T06:31:59Z","title":"RLCSD: Reinforcement Learning with Contrastive On-Policy Self-Distillation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2606.11709","snapshot_observed_at":"2026-08-11T15:14:31.268830Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.09555","last_updated":"2026-08-10T12:53:06Z","snapshot_observed_at":"2026-08-16T22:34:20.426540Z","submitted_at":"2026-08-10T12:53:06Z","title":"Bidirectional Context Self-Distillation for Reinforcement Learning of Skill-Based LLM Agents","version":1},"reference_index":74,"source":"arxiv_source","source_observed_at":"2026-08-11T15:14:31.268830Z"},"links":{"cited_paper":"/paper/2606.11709","citing_paper":"/paper/2608.09555"},"observation_digest":"sha256:770b938e199e7c7813224cc57f38cc0093b107ca5b22223acc029af3425318dc","observation_id":"9135da0c-edf4-4732-9c47-80ad2c89eb9a","resolution":{"observed_at":"2026-08-11T15:14:31.268830Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2603.05433","last_updated":"2026-07-03T04:38:21Z","snapshot_observed_at":"2026-08-15T18:08:07.785375Z","submitted_at":"2026-03-05T17:54:40Z","title":"CRISP: Compressed Reasoning via Iterative Self-Policy Distillation","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2603.05433","snapshot_observed_at":"2026-08-11T15:14:31.273003Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.09555","last_updated":"2026-08-10T12:53:06Z","snapshot_observed_at":"2026-08-16T22:34:20.426540Z","submitted_at":"2026-08-10T12:53:06Z","title":"Bidirectional Context Self-Distillation for Reinforcement Learning of Skill-Based LLM Agents","version":1},"reference_index":75,"source":"arxiv_source","source_observed_at":"2026-08-11T15:14:31.273003Z"},"links":{"cited_paper":"/paper/2603.05433","citing_paper":"/paper/2608.09555"},"observation_digest":"sha256:3d28048508899bf2d1247465ff73e824613d31f76f033fa619957f879f5678ac","observation_id":"1943922d-9eaf-45a5-892e-17d2320a0630","resolution":{"observed_at":"2026-08-11T15:14:31.273003Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-11T15:14:31.276375Z","title":"K.; Wu, Y.; and Guo, D","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.09555","last_updated":"2026-08-10T12:53:06Z","snapshot_observed_at":"2026-08-16T22:34:20.426540Z","submitted_at":"2026-08-10T12:53:06Z","title":"Bidirectional Context Self-Distillation for Reinforcement Learning of Skill-Based LLM Agents","version":1},"reference_index":76,"source":"arxiv_source","source_observed_at":"2026-08-11T15:14:31.276375Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2608.09555"},"observation_digest":"sha256:bd811f53a322b9a128c9a430498ea0986b13f0f7cbcefde07e56aae5dadb75d0","observation_id":"af4d37ac-b3d8-42e5-b92e-e11cc2b8acb3","resolution":{"observed_at":"2026-08-11T15:14:31.276375Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.11609","last_updated":"2026-05-12T06:40:43Z","snapshot_observed_at":"2026-08-16T14:20:45.919013Z","submitted_at":"2026-05-12T06:40:43Z","title":"Anti-Self-Distillation for Reasoning RL via Pointwise Mutual Information","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.11609","snapshot_observed_at":"2026-08-11T15:14:31.279791Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.09555","last_updated":"2026-08-10T12:53:06Z","snapshot_observed_at":"2026-08-16T22:34:20.426540Z","submitted_at":"2026-08-10T12:53:06Z","title":"Bidirectional Context Self-Distillation for Reinforcement Learning of Skill-Based LLM Agents","version":1},"reference_index":77,"source":"arxiv_source","source_observed_at":"2026-08-11T15:14:31.279791Z"},"links":{"cited_paper":"/paper/2605.11609","citing_paper":"/paper/2608.09555"},"observation_digest":"sha256:11923e30878b029dccc8d57e1f3d7c5a2c95454b53a0ef1d9251145e908558e0","observation_id":"f55933d3-ef4f-4477-af85-e6428f2678e7","resolution":{"observed_at":"2026-08-11T15:14:31.279791Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.06130","last_updated":"2026-05-12T10:25:23Z","snapshot_observed_at":"2026-08-15T04:46:13.708162Z","submitted_at":"2026-05-07T12:33:30Z","title":"Skill1: Unified Evolution of Skill-Augmented Agents via Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.06130","snapshot_observed_at":"2026-08-11T15:14:31.282967Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.09555","last_updated":"2026-08-10T12:53:06Z","snapshot_observed_at":"2026-08-16T22:34:20.426540Z","submitted_at":"2026-08-10T12:53:06Z","title":"Bidirectional Context Self-Distillation for Reinforcement Learning of Skill-Based LLM Agents","version":1},"reference_index":78,"source":"arxiv_source","source_observed_at":"2026-08-11T15:14:31.282967Z"},"links":{"cited_paper":"/paper/2605.06130","citing_paper":"/paper/2608.09555"},"observation_digest":"sha256:d752abacf6ec5ade7a19dcdd29f16db582bc7843225b3853109e11624e810c19","observation_id":"79d3ff01-bf7c-4ee0-8f10-d36bb43efd3a","resolution":{"observed_at":"2026-08-11T15:14:31.282967Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:14:31.897987Z","title":null,"venue":null,"work_id":"7f2229fd-9e18-4e92-b709-fad022aaf424","year":2023},"citing_paper":{"arxiv_id":"2608.09555","last_updated":"2026-08-10T12:53:06Z","snapshot_observed_at":"2026-08-16T22:34:20.426540Z","submitted_at":"2026-08-10T12:53:06Z","title":"Bidirectional Context Self-Distillation for Reinforcement Learning of Skill-Based LLM Agents","version":1},"reference_index":79,"source":"arxiv_source","source_observed_at":"2026-08-11T15:14:31.285811Z"},"links":{"citing_paper":"/paper/2608.09555"},"observation_digest":"sha256:ecf8f86442ff400a943530211afb517c75de2c9121820ed9ecfebfb1acef8f01","observation_id":"5925ede0-620e-408d-85f7-5ffcc4a6cd17","resolution":{"observed_at":"2026-08-11T15:14:31.900861Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:14:31.289006Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.09555","last_updated":"2026-08-10T12:53:06Z","snapshot_observed_at":"2026-08-16T22:34:20.426540Z","submitted_at":"2026-08-10T12:53:06Z","title":"Bidirectional Context Self-Distillation for Reinforcement Learning of Skill-Based LLM Agents","version":1},"reference_index":80,"source":"arxiv_source","source_observed_at":"2026-08-11T15:14:31.289006Z"},"links":{"citing_paper":"/paper/2608.09555"},"observation_digest":"sha256:55a74a056be182a12fbc208948cd2e07748d0e33072cdac1ee1bc36aa11c821f","observation_id":"03d315e8-672a-4aaf-9c97-5582db8c0e50","resolution":{"observed_at":"2026-08-11T15:14:31.289006Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.10674","last_updated":"2026-04-12T14:57:52Z","snapshot_observed_at":"2026-08-14T14:15:55.861698Z","submitted_at":"2026-04-12T14:57:52Z","title":"Skill-SD: Skill-Conditioned Self-Distillation for Multi-turn LLM Agents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.10674","snapshot_observed_at":"2026-08-11T15:14:31.293116Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.09555","last_updated":"2026-08-10T12:53:06Z","snapshot_observed_at":"2026-08-16T22:34:20.426540Z","submitted_at":"2026-08-10T12:53:06Z","title":"Bidirectional Context Self-Distillation for Reinforcement Learning of Skill-Based LLM Agents","version":1},"reference_index":81,"source":"arxiv_source","source_observed_at":"2026-08-11T15:14:31.293116Z"},"links":{"cited_paper":"/paper/2604.10674","citing_paper":"/paper/2608.09555"},"observation_digest":"sha256:1fcb96cd5b689e161bc451b411ee0affadb552ead76f4b1f7271483d1c02166f","observation_id":"65f63379-d7dc-45ae-a4dd-85fe6f5ba98a","resolution":{"observed_at":"2026-08-11T15:14:31.293116Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.24005","last_updated":"2026-04-29T03:05:32Z","snapshot_observed_at":"2026-08-13T09:07:17.541162Z","submitted_at":"2026-04-27T03:38:27Z","title":"TCOD: Exploring Temporal Curriculum in On-Policy Distillation for Multi-turn Autonomous Agents","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.24005","snapshot_observed_at":"2026-08-11T15:14:31.296243Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.09555","last_updated":"2026-08-10T12:53:06Z","snapshot_observed_at":"2026-08-16T22:34:20.426540Z","submitted_at":"2026-08-10T12:53:06Z","title":"Bidirectional Context Self-Distillation for Reinforcement Learning of Skill-Based LLM Agents","version":1},"reference_index":82,"source":"arxiv_source","source_observed_at":"2026-08-11T15:14:31.296243Z"},"links":{"cited_paper":"/paper/2604.24005","citing_paper":"/paper/2608.09555"},"observation_digest":"sha256:091ef2457a6329b0ea88da4430ec7d3c3618e93bc91c0d020c837cf03e8d4ba3","observation_id":"4a6e1d17-bafa-4b86-896e-574f0074307b","resolution":{"observed_at":"2026-08-11T15:14:31.296243Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:14:31.880050Z","title":null,"venue":null,"work_id":"0d2c6d8e-b88b-4581-9da7-778ffd2d8ec0","year":2026},"citing_paper":{"arxiv_id":"2608.09555","last_updated":"2026-08-10T12:53:06Z","snapshot_observed_at":"2026-08-16T22:34:20.426540Z","submitted_at":"2026-08-10T12:53:06Z","title":"Bidirectional Context Self-Distillation for Reinforcement Learning of Skill-Based LLM Agents","version":1},"reference_index":83,"source":"arxiv_source","source_observed_at":"2026-08-11T15:14:31.299306Z"},"links":{"citing_paper":"/paper/2608.09555"},"observation_digest":"sha256:f9013845cf537fc2c2ba3e522ddc60da8fd3b3f217cd93f5277101d908a565e5","observation_id":"696b4123-bccf-47e3-9afe-e2687846f7ec","resolution":{"observed_at":"2026-08-11T15:14:31.883537Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2602.12430","last_updated":"2026-06-02T16:14:54Z","snapshot_observed_at":"2026-08-06T11:11:16.632352Z","submitted_at":"2026-02-12T21:33:25Z","title":"Agent Skills for Large Language Models: Architecture, Acquisition, Security, and the Path Forward","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2602.12430","snapshot_observed_at":"2026-08-11T15:14:31.302274Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.09555","last_updated":"2026-08-10T12:53:06Z","snapshot_observed_at":"2026-08-16T22:34:20.426540Z","submitted_at":"2026-08-10T12:53:06Z","title":"Bidirectional Context Self-Distillation for Reinforcement Learning of Skill-Based LLM Agents","version":1},"reference_index":84,"source":"arxiv_source","source_observed_at":"2026-08-11T15:14:31.302274Z"},"links":{"cited_paper":"/paper/2602.12430","citing_paper":"/paper/2608.09555"},"observation_digest":"sha256:af619e836c0eda6fd9572e6981d19403354db058ece2a5623b7a67aff2bbf21a","observation_id":"a6f46b7f-6602-40b4-bc82-886745447927","resolution":{"observed_at":"2026-08-11T15:14:31.302274Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-08-11T15:14:31.305540Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.09555","last_updated":"2026-08-10T12:53:06Z","snapshot_observed_at":"2026-08-16T22:34:20.426540Z","submitted_at":"2026-08-10T12:53:06Z","title":"Bidirectional Context Self-Distillation for Reinforcement Learning of Skill-Based LLM Agents","version":1},"reference_index":85,"source":"arxiv_source","source_observed_at":"2026-08-11T15:14:31.305540Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2608.09555"},"observation_digest":"sha256:066afc812b532b77a6d640fdda592469828e5a3bf8ef3b58e3ddb7a3ab1a636a","observation_id":"f746a172-24c2-4525-ab6c-2d609408231b","resolution":{"observed_at":"2026-08-11T15:14:31.305540Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15115","snapshot_observed_at":"2026-08-11T15:14:31.309205Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.09555","last_updated":"2026-08-10T12:53:06Z","snapshot_observed_at":"2026-08-16T22:34:20.426540Z","submitted_at":"2026-08-10T12:53:06Z","title":"Bidirectional Context Self-Distillation for Reinforcement Learning of Skill-Based LLM Agents","version":1},"reference_index":86,"source":"arxiv_source","source_observed_at":"2026-08-11T15:14:31.309205Z"},"links":{"cited_paper":"/paper/2412.15115","citing_paper":"/paper/2608.09555"},"observation_digest":"sha256:4a00bc240eae3a8f1414b362d02f1df696faef89163236733453f1d8c22b929c","observation_id":"c4a4b54e-0ca0-4b12-9818-4f47142fabfa","resolution":{"observed_at":"2026-08-11T15:14:31.309205Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.03128","last_updated":"2026-04-08T08:22:36Z","snapshot_observed_at":"2026-08-03T04:49:13.270533Z","submitted_at":"2026-04-03T15:50:07Z","title":"Self-Distilled RLVR","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.03128","snapshot_observed_at":"2026-08-11T15:14:31.312419Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.09555","last_updated":"2026-08-10T12:53:06Z","snapshot_observed_at":"2026-08-16T22:34:20.426540Z","submitted_at":"2026-08-10T12:53:06Z","title":"Bidirectional Context Self-Distillation for Reinforcement Learning of Skill-Based LLM Agents","version":1},"reference_index":87,"source":"arxiv_source","source_observed_at":"2026-08-11T15:14:31.312419Z"},"links":{"cited_paper":"/paper/2604.03128","citing_paper":"/paper/2608.09555"},"observation_digest":"sha256:07526c702ef19212aae2196d27193fc33fa417e79258f4febd26835d1e72c81a","observation_id":"53025679-a086-473e-8a08-d6103d765c5c","resolution":{"observed_at":"2026-08-11T15:14:31.312419Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2606.26790","last_updated":"2026-06-25T09:24:09Z","snapshot_observed_at":"2026-08-13T16:34:23.083434Z","submitted_at":"2026-06-25T09:24:09Z","title":"OPID: On-Policy Skill Distillation for Agentic Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2606.26790","snapshot_observed_at":"2026-08-11T15:14:31.316254Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.09555","last_updated":"2026-08-10T12:53:06Z","snapshot_observed_at":"2026-08-16T22:34:20.426540Z","submitted_at":"2026-08-10T12:53:06Z","title":"Bidirectional Context Self-Distillation for Reinforcement Learning of Skill-Based LLM Agents","version":1},"reference_index":88,"source":"arxiv_source","source_observed_at":"2026-08-11T15:14:31.316254Z"},"links":{"cited_paper":"/paper/2606.26790","citing_paper":"/paper/2608.09555"},"observation_digest":"sha256:0f7bd316e1dc000e95b6e7a889ba8a8a31b1d42de6b175c3ec8b3727c19e83ae","observation_id":"f5ef13e7-1098-48c1-96ef-4159d503cbcd","resolution":{"observed_at":"2026-08-11T15:14:31.316254Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.12400","last_updated":"2026-05-29T21:49:52Z","snapshot_observed_at":"2026-08-16T05:04:08.891684Z","submitted_at":"2026-05-12T17:00:53Z","title":"OGLS-SD: On-Policy Self-Distillation with Outcome-Guided Logit Steering for LLM Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.12400","snapshot_observed_at":"2026-08-11T15:14:31.319381Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.09555","last_updated":"2026-08-10T12:53:06Z","snapshot_observed_at":"2026-08-16T22:34:20.426540Z","submitted_at":"2026-08-10T12:53:06Z","title":"Bidirectional Context Self-Distillation for Reinforcement Learning of Skill-Based LLM Agents","version":1},"reference_index":89,"source":"arxiv_source","source_observed_at":"2026-08-11T15:14:31.319381Z"},"links":{"cited_paper":"/paper/2605.12400","citing_paper":"/paper/2608.09555"},"observation_digest":"sha256:5d975b8b93a496d356e44a426d1a193d118e0e4143671c01c30e0d00cf7bec7f","observation_id":"406e0b03-90a7-46b6-93ee-5ce3060a1db3","resolution":{"observed_at":"2026-08-11T15:14:31.319381Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:14:31.868594Z","title":null,"venue":null,"work_id":"641acf8b-eff2-43f2-920e-7f3f851ea762","year":2022},"citing_paper":{"arxiv_id":"2608.09555","last_updated":"2026-08-10T12:53:06Z","snapshot_observed_at":"2026-08-16T22:34:20.426540Z","submitted_at":"2026-08-10T12:53:06Z","title":"Bidirectional Context Self-Distillation for Reinforcement Learning of Skill-Based LLM Agents","version":1},"reference_index":90,"source":"arxiv_source","source_observed_at":"2026-08-11T15:14:31.323263Z"},"links":{"citing_paper":"/paper/2608.09555"},"observation_digest":"sha256:e1e28c3f3a2236727938428d4107872e675acb5c31935310dbbb8f387c89913e","observation_id":"f08f7ea4-21a0-4269-b632-0ab9f03f23e1","resolution":{"observed_at":"2026-08-11T15:14:31.872955Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:14:31.856686Z","title":null,"venue":null,"work_id":"d7e39046-c0d4-4dcc-b23f-98126e0c2080","year":2023},"citing_paper":{"arxiv_id":"2608.09555","last_updated":"2026-08-10T12:53:06Z","snapshot_observed_at":"2026-08-16T22:34:20.426540Z","submitted_at":"2026-08-10T12:53:06Z","title":"Bidirectional Context Self-Distillation for Reinforcement Learning of Skill-Based LLM Agents","version":1},"reference_index":91,"source":"arxiv_source","source_observed_at":"2026-08-11T15:14:31.328269Z"},"links":{"citing_paper":"/paper/2608.09555"},"observation_digest":"sha256:e6da3182245af23ef23431b2c454c8daad6be0e522e7ac024b12b152d4ccb16c","observation_id":"88209d9f-c0b7-47df-a118-3fe92ac2f159","resolution":{"observed_at":"2026-08-11T15:14:31.860620Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2605.10500","last_updated":"2026-05-11T12:58:25Z","snapshot_observed_at":"2026-08-17T01:39:46.297959Z","submitted_at":"2026-05-11T12:58:25Z","title":"SkillEvolver: Skill Learning as a Meta-Skill","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.10500","snapshot_observed_at":"2026-08-11T15:14:31.332594Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.09555","last_updated":"2026-08-10T12:53:06Z","snapshot_observed_at":"2026-08-16T22:34:20.426540Z","submitted_at":"2026-08-10T12:53:06Z","title":"Bidirectional Context Self-Distillation for Reinforcement Learning of Skill-Based LLM Agents","version":1},"reference_index":92,"source":"arxiv_source","source_observed_at":"2026-08-11T15:14:31.332594Z"},"links":{"cited_paper":"/paper/2605.10500","citing_paper":"/paper/2608.09555"},"observation_digest":"sha256:1e705dedda458780625177cc6fa00befe7db16085acebecd6205c7fc8ae5c4dc","observation_id":"a9b215d6-3d46-4fa7-bae0-17f50f5065f8","resolution":{"observed_at":"2026-08-11T15:14:31.332594Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.17535","last_updated":"2026-04-19T16:53:56Z","snapshot_observed_at":"2026-08-13T17:23:59.909337Z","submitted_at":"2026-04-19T16:53:56Z","title":"OPSDL: On-Policy Self-Distillation for Long-Context Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.17535","snapshot_observed_at":"2026-08-11T15:14:31.336027Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.09555","last_updated":"2026-08-10T12:53:06Z","snapshot_observed_at":"2026-08-16T22:34:20.426540Z","submitted_at":"2026-08-10T12:53:06Z","title":"Bidirectional Context Self-Distillation for Reinforcement Learning of Skill-Based LLM Agents","version":1},"reference_index":93,"source":"arxiv_source","source_observed_at":"2026-08-11T15:14:31.336027Z"},"links":{"cited_paper":"/paper/2604.17535","citing_paper":"/paper/2608.09555"},"observation_digest":"sha256:d02eab9717ede80623899ce2e7e0b84013e9f833a7a7d8f0cc9d6603074d5a2f","observation_id":"0be07b05-d407-4886-b3e9-ad59563e7207","resolution":{"observed_at":"2026-08-11T15:14:31.336027Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.27140","last_updated":"2026-05-26T15:07:03Z","snapshot_observed_at":"2026-08-16T10:18:41.906401Z","submitted_at":"2026-05-26T15:07:03Z","title":"StepOPSD: Step-Aware Online Preference Distillation for Agent Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.27140","snapshot_observed_at":"2026-08-11T15:14:31.339899Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.09555","last_updated":"2026-08-10T12:53:06Z","snapshot_observed_at":"2026-08-16T22:34:20.426540Z","submitted_at":"2026-08-10T12:53:06Z","title":"Bidirectional Context Self-Distillation for Reinforcement Learning of Skill-Based LLM Agents","version":1},"reference_index":94,"source":"arxiv_source","source_observed_at":"2026-08-11T15:14:31.339899Z"},"links":{"cited_paper":"/paper/2605.27140","citing_paper":"/paper/2608.09555"},"observation_digest":"sha256:028fe98272c435c91ac0f04129265e0a1ecc9e5bd44cf6ec17a2c255a3f61b3c","observation_id":"09ad5cc2-8a49-43e4-9f4d-fdf361eb19f7","resolution":{"observed_at":"2026-08-11T15:14:31.339899Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:14:31.844119Z","title":null,"venue":null,"work_id":"f5484703-cc08-4cdb-b5e8-6bb5dadf17c9","year":2026},"citing_paper":{"arxiv_id":"2608.09555","last_updated":"2026-08-10T12:53:06Z","snapshot_observed_at":"2026-08-16T22:34:20.426540Z","submitted_at":"2026-08-10T12:53:06Z","title":"Bidirectional Context Self-Distillation for Reinforcement Learning of Skill-Based LLM Agents","version":1},"reference_index":95,"source":"arxiv_source","source_observed_at":"2026-08-11T15:14:31.343797Z"},"links":{"citing_paper":"/paper/2608.09555"},"observation_digest":"sha256:8edde5000878a64082b14f9344e92f2933addb8ff48aad09d23df8435d0f0243","observation_id":"2a11cf51-f63a-403c-aa6c-549e0cf300b3","resolution":{"observed_at":"2026-08-11T15:14:31.848387Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2604.10688","last_updated":"2026-05-30T16:08:24Z","snapshot_observed_at":"2026-08-14T18:05:40.907227Z","submitted_at":"2026-04-12T15:26:14Z","title":"SCOPE: Signal-Calibrated On-Policy Distillation Enhancement with Dual-Path Adaptive Weighting","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.10688","snapshot_observed_at":"2026-08-11T15:14:31.348326Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.09555","last_updated":"2026-08-10T12:53:06Z","snapshot_observed_at":"2026-08-16T22:34:20.426540Z","submitted_at":"2026-08-10T12:53:06Z","title":"Bidirectional Context Self-Distillation for Reinforcement Learning of Skill-Based LLM Agents","version":1},"reference_index":96,"source":"arxiv_source","source_observed_at":"2026-08-11T15:14:31.348326Z"},"links":{"cited_paper":"/paper/2604.10688","citing_paper":"/paper/2608.09555"},"observation_digest":"sha256:055d018242bff0f108822735a9fd0f7761eee83a3a4b7635ba482364e3f388fc","observation_id":"2782d5f9-46e7-437d-90e8-8929a3f50b8b","resolution":{"observed_at":"2026-08-11T15:14:31.348326Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.07725","last_updated":"2026-08-03T03:33:59Z","snapshot_observed_at":"2026-08-14T23:07:50.063910Z","submitted_at":"2026-05-08T13:30:42Z","title":"SOD: Step-wise On-policy Distillation for Small Language Model Agents","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.07725","snapshot_observed_at":"2026-08-11T15:14:31.352194Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.09555","last_updated":"2026-08-10T12:53:06Z","snapshot_observed_at":"2026-08-16T22:34:20.426540Z","submitted_at":"2026-08-10T12:53:06Z","title":"Bidirectional Context Self-Distillation for Reinforcement Learning of Skill-Based LLM Agents","version":1},"reference_index":97,"source":"arxiv_source","source_observed_at":"2026-08-11T15:14:31.352194Z"},"links":{"cited_paper":"/paper/2605.07725","citing_paper":"/paper/2608.09555"},"observation_digest":"sha256:4d7d36f3cf55e3cb72554e338f6dfca923c2af375fe8d582d6fb414b9a9e0fbf","observation_id":"599e9b4b-7b41-4dfb-b197-fbe4ed3e0544","resolution":{"observed_at":"2026-08-11T15:14:31.352194Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2608.09555","last_updated":"2026-08-10T12:53:06Z","latest_version":1,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-16T22:34:20.426540Z","submitted_at":"2026-08-10T12:53:06Z","title":"Bidirectional Context Self-Distillation for Reinforcement Learning of Skill-Based LLM Agents"},"reference_resolution":{"displayed":69,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":55,"verified_exact":1,"verified_fuzzy":13},"total_outbound_references":69},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"thesis":"As of 17 August 2026, this Paper Citation Record lists 69 of 69 outbound references and 0 inbound Pith citation observations for arXiv:2608.09555."}