{"as_of":"2026-08-20T05:04:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:a1fdc40b2b9141ab0af76cbb4fb6131fe618a4d79a38aaed9e05ec9c60b538dd","coverage":[{"denominator":39,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":39,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T14:32:47.290687Z","state":"measured"},{"denominator":39,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":39,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-19T06:32:44.657259+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2608.07371/citation-record","integrity":"/paper/2608.07371/integrity","json":"/paper/2608.07371/citation-record.json","paper":"/paper/2608.07371"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:32:47.153181Z","title":"Advances in Neural Information Processing Systems , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.07371","last_updated":"2026-08-07T16:12:58Z","snapshot_observed_at":"2026-08-20T02:29:30.779952Z","submitted_at":"2026-08-07T16:12:58Z","title":"Trajectory-Relative Hindsight Distillation for Agentic Reinforcement Learning","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-15T14:32:47.153181Z"},"links":{"citing_paper":"/paper/2608.07371"},"observation_digest":"sha256:b8a3393a2006e01f17766592d0f0d19266c12c6939279c605770aa39e71bfc15","observation_id":"43af2e35-8b6b-4a77-b853-75fb78390afb","resolution":{"observed_at":"2026-08-15T14:32:47.153181Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.15607/rss.2018.xiv.008","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:32:47.344185Z","title":"Robotics: Science and Systems XIV , year =","venue":null,"work_id":"ca18f734-d356-4679-ad63-3067b36a1188","year":2018},"citing_paper":{"arxiv_id":"2608.07371","last_updated":"2026-08-07T16:12:58Z","snapshot_observed_at":"2026-08-20T02:29:30.779952Z","submitted_at":"2026-08-07T16:12:58Z","title":"Trajectory-Relative Hindsight Distillation for Agentic Reinforcement Learning","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-15T14:32:47.158990Z"},"links":{"citing_paper":"/paper/2608.07371"},"observation_digest":"sha256:07426794e4a8866c8de4187438e917aa5da2c8f0f40adeca11be0c1d2452ebd4","observation_id":"d882b2c6-7e5b-40d3-a6bf-9fbb63ddb08f","resolution":{"observed_at":"2026-08-15T14:32:47.347370Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-17T18:38:15.476193+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-17T18:38:15.476193+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:32:47.162667Z","title":"2024 , eprint =","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.07371","last_updated":"2026-08-07T16:12:58Z","snapshot_observed_at":"2026-08-20T02:29:30.779952Z","submitted_at":"2026-08-07T16:12:58Z","title":"Trajectory-Relative Hindsight Distillation for Agentic Reinforcement Learning","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-15T14:32:47.162667Z"},"links":{"citing_paper":"/paper/2608.07371"},"observation_digest":"sha256:e91667d24ead5551e06b7fb11a2dd9e0b814bab73771d0077366b507ce0b5808","observation_id":"45955c89-a13a-4101-a2e5-fb155d762ac8","resolution":{"observed_at":"2026-08-15T14:32:47.162667Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:32:47.165985Z","title":"2024 , eprint =","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.07371","last_updated":"2026-08-07T16:12:58Z","snapshot_observed_at":"2026-08-20T02:29:30.779952Z","submitted_at":"2026-08-07T16:12:58Z","title":"Trajectory-Relative Hindsight Distillation for Agentic Reinforcement Learning","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-15T14:32:47.165985Z"},"links":{"citing_paper":"/paper/2608.07371"},"observation_digest":"sha256:fe9fd19ca41c06a1330d01e63a6c66eaf2421fc543ffdf1c663d63760560905d","observation_id":"b1df07b0-d27a-45fe-b124-7cee04b408f8","resolution":{"observed_at":"2026-08-15T14:32:47.165985Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.20073","last_updated":"2025-05-26T17:19:30Z","snapshot_observed_at":"2026-08-13T08:41:26.093022Z","submitted_at":"2025-04-24T17:57:08Z","title":"RAGEN: Understanding Self-Evolution in LLM Agents via Multi-Turn Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.20073","snapshot_observed_at":"2026-08-15T14:32:47.169375Z","title":"2504.20073 , archivePrefix =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.07371","last_updated":"2026-08-07T16:12:58Z","snapshot_observed_at":"2026-08-20T02:29:30.779952Z","submitted_at":"2026-08-07T16:12:58Z","title":"Trajectory-Relative Hindsight Distillation for Agentic Reinforcement Learning","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-15T14:32:47.169375Z"},"links":{"cited_paper":"/paper/2504.20073","citing_paper":"/paper/2608.07371"},"observation_digest":"sha256:9337ddba6c2520093ba48371a19d6db925a3f0654a82852523d6bcf0e38a9455","observation_id":"40cef15e-f13c-4663-947d-2283b7be1d0a","resolution":{"observed_at":"2026-08-15T14:32:47.169375Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:32:47.807273Z","title":"Group-in-Group Policy Optimization for","venue":null,"work_id":"d5877765-ac36-41f8-a4e0-e9c877228c53","year":2025},"citing_paper":{"arxiv_id":"2608.07371","last_updated":"2026-08-07T16:12:58Z","snapshot_observed_at":"2026-08-20T02:29:30.779952Z","submitted_at":"2026-08-07T16:12:58Z","title":"Trajectory-Relative Hindsight Distillation for Agentic Reinforcement Learning","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-15T14:32:47.173342Z"},"links":{"citing_paper":"/paper/2608.07371"},"observation_digest":"sha256:62bfd2ceca114ab1def264549eab60682a4016257d36767bdc15ea734e4de3d6","observation_id":"590e8453-8ced-4a3d-9d75-1bbe6cf84e16","resolution":{"observed_at":"2026-08-15T14:32:47.810510Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:32:47.176697Z","title":"2026 , eprint =","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.07371","last_updated":"2026-08-07T16:12:58Z","snapshot_observed_at":"2026-08-20T02:29:30.779952Z","submitted_at":"2026-08-07T16:12:58Z","title":"Trajectory-Relative Hindsight Distillation for Agentic Reinforcement Learning","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-15T14:32:47.176697Z"},"links":{"citing_paper":"/paper/2608.07371"},"observation_digest":"sha256:f5420c5627482fb73610db12c7998efcb72e8f66bd90c3a7fe0024aef9bd31bd","observation_id":"892b1006-3112-42c9-a7be-5675cb4b0bee","resolution":{"observed_at":"2026-08-15T14:32:47.176697Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:32:47.179849Z","title":"2026 , eprint =","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.07371","last_updated":"2026-08-07T16:12:58Z","snapshot_observed_at":"2026-08-20T02:29:30.779952Z","submitted_at":"2026-08-07T16:12:58Z","title":"Trajectory-Relative Hindsight Distillation for Agentic Reinforcement Learning","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-15T14:32:47.179849Z"},"links":{"citing_paper":"/paper/2608.07371"},"observation_digest":"sha256:4cfc854d5b025bbcb6959bdb1ac93311672a2811e30569726ba096fedb025834","observation_id":"598177fa-89c7-4cda-9663-6546f2e75202","resolution":{"observed_at":"2026-08-15T14:32:47.179849Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.03128","last_updated":"2026-04-08T08:22:36Z","snapshot_observed_at":"2026-08-03T04:49:13.270533Z","submitted_at":"2026-04-03T15:50:07Z","title":"Self-Distilled RLVR","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.03128","snapshot_observed_at":"2026-08-15T14:32:47.183433Z","title":"Self-Distilled","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.07371","last_updated":"2026-08-07T16:12:58Z","snapshot_observed_at":"2026-08-20T02:29:30.779952Z","submitted_at":"2026-08-07T16:12:58Z","title":"Trajectory-Relative Hindsight Distillation for Agentic Reinforcement Learning","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-15T14:32:47.183433Z"},"links":{"cited_paper":"/paper/2604.03128","citing_paper":"/paper/2608.07371"},"observation_digest":"sha256:dc49b6e7a5b013110bbe4d6c31593402a13c1777607b803f189e262bcd183f0c","observation_id":"2004b62c-5367-4e00-8db3-131d370d0c8d","resolution":{"observed_at":"2026-08-15T14:32:47.183433Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.10674","last_updated":"2026-04-12T14:57:52Z","snapshot_observed_at":"2026-08-18T16:44:14.964518Z","submitted_at":"2026-04-12T14:57:52Z","title":"Skill-SD: Skill-Conditioned Self-Distillation for Multi-turn LLM Agents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.10674","snapshot_observed_at":"2026-08-15T14:32:47.188247Z","title":"2604.10674 , archivePrefix =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.07371","last_updated":"2026-08-07T16:12:58Z","snapshot_observed_at":"2026-08-20T02:29:30.779952Z","submitted_at":"2026-08-07T16:12:58Z","title":"Trajectory-Relative Hindsight Distillation for Agentic Reinforcement Learning","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-15T14:32:47.188247Z"},"links":{"cited_paper":"/paper/2604.10674","citing_paper":"/paper/2608.07371"},"observation_digest":"sha256:85d56e6617f9867c10ff015415fe9218f50b68203548990ff68bad34c2d43182","observation_id":"4c22479f-2c14-4c62-bf45-b6947037748e","resolution":{"observed_at":"2026-08-15T14:32:47.188247Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.14084","last_updated":"2026-05-21T05:36:13Z","snapshot_observed_at":"2026-08-12T12:04:07.125000Z","submitted_at":"2026-04-15T16:58:24Z","title":"TIP: Token Importance in On-Policy Distillation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.14084","snapshot_observed_at":"2026-08-15T14:32:47.191944Z","title":"2604.14084 , archivePrefix =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.07371","last_updated":"2026-08-07T16:12:58Z","snapshot_observed_at":"2026-08-20T02:29:30.779952Z","submitted_at":"2026-08-07T16:12:58Z","title":"Trajectory-Relative Hindsight Distillation for Agentic Reinforcement Learning","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-15T14:32:47.191944Z"},"links":{"cited_paper":"/paper/2604.14084","citing_paper":"/paper/2608.07371"},"observation_digest":"sha256:0490e5eb85fc33ce9598824cb01897a735938a26416da256b37ef87b8edffd1e","observation_id":"6a497627-3db7-4365-9863-3381caafb392","resolution":{"observed_at":"2026-08-15T14:32:47.191944Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.24005","last_updated":"2026-04-29T03:05:32Z","snapshot_observed_at":"2026-08-13T09:07:17.541162Z","submitted_at":"2026-04-27T03:38:27Z","title":"TCOD: Exploring Temporal Curriculum in On-Policy Distillation for Multi-turn Autonomous Agents","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.24005","snapshot_observed_at":"2026-08-15T14:32:47.195468Z","title":"2604.24005 , archivePrefix =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.07371","last_updated":"2026-08-07T16:12:58Z","snapshot_observed_at":"2026-08-20T02:29:30.779952Z","submitted_at":"2026-08-07T16:12:58Z","title":"Trajectory-Relative Hindsight Distillation for Agentic Reinforcement Learning","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-15T14:32:47.195468Z"},"links":{"cited_paper":"/paper/2604.24005","citing_paper":"/paper/2608.07371"},"observation_digest":"sha256:88641440261cf4e83e1bca64b9e7e36054bc737683480430e5fc1f5617c40bd6","observation_id":"40697789-9769-4ddc-8676-b87b8aadbe91","resolution":{"observed_at":"2026-08-15T14:32:47.195468Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:32:47.199425Z","title":"2026 , eprint =","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.07371","last_updated":"2026-08-07T16:12:58Z","snapshot_observed_at":"2026-08-20T02:29:30.779952Z","submitted_at":"2026-08-07T16:12:58Z","title":"Trajectory-Relative Hindsight Distillation for Agentic Reinforcement Learning","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-15T14:32:47.199425Z"},"links":{"citing_paper":"/paper/2608.07371"},"observation_digest":"sha256:7fcd08cfbfa864f617fb48aaecd8c8201ee8d7727dd459b40d18a3e9c1590a5e","observation_id":"1457809d-0d90-4605-a119-62cdfcfb6904","resolution":{"observed_at":"2026-08-15T14:32:47.199425Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.27186","last_updated":"2026-05-26T15:38:46Z","snapshot_observed_at":"2026-08-19T00:11:44.218225Z","submitted_at":"2026-05-26T15:38:46Z","title":"MAIGO: Mitigating Lost-in-Conversation with History-Cleaned On-Policy Self-Distillation","version":1},"cited_work":{"arxiv_id":"2605.27186","doi":null,"metadata_source":"pith","pith_arxiv_id":"2605.27186","snapshot_observed_at":"2026-08-15T14:32:47.642095Z","title":"MAIGO: Mitigating Lost-in-Conversation with History-Cleaned On-Policy Self-Distillation","venue":"cs.CL","work_id":"3402f4ba-a23a-46c7-809a-87c484a7b8af","year":2026},"citing_paper":{"arxiv_id":"2608.07371","last_updated":"2026-08-07T16:12:58Z","snapshot_observed_at":"2026-08-20T02:29:30.779952Z","submitted_at":"2026-08-07T16:12:58Z","title":"Trajectory-Relative Hindsight Distillation for Agentic Reinforcement Learning","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-15T14:32:47.202666Z"},"links":{"cited_paper":"/paper/2605.27186","citing_paper":"/paper/2608.07371"},"observation_digest":"sha256:f6c78a96da176bf53922d7fe8bf86335463679490668925014593bef503c0472","observation_id":"49d7e6e7-d96b-499d-aff1-cbe99ab49061","resolution":{"observed_at":"2026-08-15T14:32:47.645907Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:32:47.206077Z","title":"2026 , eprint =","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.07371","last_updated":"2026-08-07T16:12:58Z","snapshot_observed_at":"2026-08-20T02:29:30.779952Z","submitted_at":"2026-08-07T16:12:58Z","title":"Trajectory-Relative Hindsight Distillation for Agentic Reinforcement Learning","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-15T14:32:47.206077Z"},"links":{"citing_paper":"/paper/2608.07371"},"observation_digest":"sha256:a29c4ab4d0b49922539d4fbcd24c18f1e93666946ce0216919498d31ef038a06","observation_id":"7e4e1bc5-677a-44e2-8e03-d79747a8f281","resolution":{"observed_at":"2026-08-15T14:32:47.206077Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.27140","last_updated":"2026-05-26T15:07:03Z","snapshot_observed_at":"2026-08-16T10:18:41.906401Z","submitted_at":"2026-05-26T15:07:03Z","title":"StepOPSD: Step-Aware Online Preference Distillation for Agent Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.27140","snapshot_observed_at":"2026-08-15T14:32:47.209479Z","title":"2605.27140 , archivePrefix =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.07371","last_updated":"2026-08-07T16:12:58Z","snapshot_observed_at":"2026-08-20T02:29:30.779952Z","submitted_at":"2026-08-07T16:12:58Z","title":"Trajectory-Relative Hindsight Distillation for Agentic Reinforcement Learning","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-15T14:32:47.209479Z"},"links":{"cited_paper":"/paper/2605.27140","citing_paper":"/paper/2608.07371"},"observation_digest":"sha256:be09434498257cc39531f6e633f45b2ad58c0d65b8b5aca99c63d6f5785443ad","observation_id":"cdfa1f23-c784-4d8c-b20b-647e48fbc0f3","resolution":{"observed_at":"2026-08-15T14:32:47.209479Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.17873","last_updated":"2026-05-18T05:34:03Z","snapshot_observed_at":"2026-08-15T03:08:48.800661Z","submitted_at":"2026-05-18T05:34:03Z","title":"HINT-SD: Targeted Hindsight Self-Distillation for Long-Horizon Agents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.17873","snapshot_observed_at":"2026-08-15T14:32:47.213039Z","title":"2605.17873 , archivePrefix =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.07371","last_updated":"2026-08-07T16:12:58Z","snapshot_observed_at":"2026-08-20T02:29:30.779952Z","submitted_at":"2026-08-07T16:12:58Z","title":"Trajectory-Relative Hindsight Distillation for Agentic Reinforcement Learning","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-15T14:32:47.213039Z"},"links":{"cited_paper":"/paper/2605.17873","citing_paper":"/paper/2608.07371"},"observation_digest":"sha256:ee702fe91093750aa866762fe3fe4ee713d89830d9e3b7d8b9f661f7345b587f","observation_id":"e7841065-f830-445d-b8ff-e7406788012d","resolution":{"observed_at":"2026-08-15T14:32:47.213039Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.11853","last_updated":"2026-05-14T10:19:32Z","snapshot_observed_at":"2026-08-14T20:01:38.086441Z","submitted_at":"2026-05-12T09:38:38Z","title":"GEAR: Granularity-Adaptive Advantage Reweighting for LLM Agents via Self-Distillation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.11853","snapshot_observed_at":"2026-08-15T14:32:47.216744Z","title":"2605.11853 , archivePrefix =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.07371","last_updated":"2026-08-07T16:12:58Z","snapshot_observed_at":"2026-08-20T02:29:30.779952Z","submitted_at":"2026-08-07T16:12:58Z","title":"Trajectory-Relative Hindsight Distillation for Agentic Reinforcement Learning","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-15T14:32:47.216744Z"},"links":{"cited_paper":"/paper/2605.11853","citing_paper":"/paper/2608.07371"},"observation_digest":"sha256:a54a57a0bc1346f2b932421cb6d6d9a5a03d070f8ba00e0d498fe8367fa7bbb2","observation_id":"e6576559-7c75-4aab-835c-1b2429f6e0a4","resolution":{"observed_at":"2026-08-15T14:32:47.216744Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2606.26790","last_updated":"2026-06-25T09:24:09Z","snapshot_observed_at":"2026-08-13T16:34:23.083434Z","submitted_at":"2026-06-25T09:24:09Z","title":"OPID: On-Policy Skill Distillation for Agentic Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2606.26790","snapshot_observed_at":"2026-08-15T14:32:47.220446Z","title":"2606.26790 , archivePrefix =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.07371","last_updated":"2026-08-07T16:12:58Z","snapshot_observed_at":"2026-08-20T02:29:30.779952Z","submitted_at":"2026-08-07T16:12:58Z","title":"Trajectory-Relative Hindsight Distillation for Agentic Reinforcement Learning","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-15T14:32:47.220446Z"},"links":{"cited_paper":"/paper/2606.26790","citing_paper":"/paper/2608.07371"},"observation_digest":"sha256:b59d774fbf158f606e0487beb343ec6f559a71237ffe6151961a36a811cdcf74","observation_id":"32442963-7db3-4cc0-a4f2-71475cb1dfb0","resolution":{"observed_at":"2026-08-15T14:32:47.220446Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2606.09348","last_updated":"2026-07-06T08:44:01Z","snapshot_observed_at":"2026-08-06T19:49:04.152420Z","submitted_at":"2026-06-08T11:20:58Z","title":"PBSD: Privileged Bayesian Self-Distillation for Long-Horizon Credit Assignment","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2606.09348","snapshot_observed_at":"2026-08-15T14:32:47.223649Z","title":"2606.09348 , archivePrefix =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.07371","last_updated":"2026-08-07T16:12:58Z","snapshot_observed_at":"2026-08-20T02:29:30.779952Z","submitted_at":"2026-08-07T16:12:58Z","title":"Trajectory-Relative Hindsight Distillation for Agentic Reinforcement Learning","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-15T14:32:47.223649Z"},"links":{"cited_paper":"/paper/2606.09348","citing_paper":"/paper/2608.07371"},"observation_digest":"sha256:78402b4983d1e1fc0854258a6f322b07f763245d500cc66eceff94288a265031","observation_id":"e93cda6d-58b7-491a-956b-429b01ad9891","resolution":{"observed_at":"2026-08-15T14:32:47.223649Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:32:47.227342Z","title":"2603.18683 , archivePrefix =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.07371","last_updated":"2026-08-07T16:12:58Z","snapshot_observed_at":"2026-08-20T02:29:30.779952Z","submitted_at":"2026-08-07T16:12:58Z","title":"Trajectory-Relative Hindsight Distillation for Agentic Reinforcement Learning","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-15T14:32:47.227342Z"},"links":{"citing_paper":"/paper/2608.07371"},"observation_digest":"sha256:fee219c4be54a878572a9e4d37799bb3694b6f6ed450827e1875d81829368fc5","observation_id":"bdbfe7a7-1e4e-4aed-af23-6a706b3a777e","resolution":{"observed_at":"2026-08-15T14:32:47.227342Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:32:47.771144Z","title":"2026 , eprint =","venue":null,"work_id":"d8ee861d-f03d-400b-aa2c-5932e0a2e6c3","year":2026},"citing_paper":{"arxiv_id":"2608.07371","last_updated":"2026-08-07T16:12:58Z","snapshot_observed_at":"2026-08-20T02:29:30.779952Z","submitted_at":"2026-08-07T16:12:58Z","title":"Trajectory-Relative Hindsight Distillation for Agentic Reinforcement Learning","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-15T14:32:47.230480Z"},"links":{"citing_paper":"/paper/2608.07371"},"observation_digest":"sha256:a8dfd83f72f6ed5d0a075adec5ad2ef1f150f3105fb61d7933088a3db43f66ba","observation_id":"9bdf08b6-28bb-43c5-af36-bf921743eded","resolution":{"observed_at":"2026-08-15T14:32:47.774080Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2606.11559","last_updated":"2026-06-10T01:35:34Z","snapshot_observed_at":"2026-08-13T12:14:59.791076Z","submitted_at":"2026-06-10T01:35:34Z","title":"HERO: Hindsight-Enhanced Reflection from Environment Observations for Agentic Self-Distillation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2606.11559","snapshot_observed_at":"2026-08-15T14:32:47.233941Z","title":"2606.11559 , archivePrefix =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.07371","last_updated":"2026-08-07T16:12:58Z","snapshot_observed_at":"2026-08-20T02:29:30.779952Z","submitted_at":"2026-08-07T16:12:58Z","title":"Trajectory-Relative Hindsight Distillation for Agentic Reinforcement Learning","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-15T14:32:47.233941Z"},"links":{"cited_paper":"/paper/2606.11559","citing_paper":"/paper/2608.07371"},"observation_digest":"sha256:c73a2456b7bdb8751aefedaa55907b9d70a81818144f5f2d8d69d5e1e8321f82","observation_id":"d65bb8c2-9c52-485c-97f6-ef1902e6c21d","resolution":{"observed_at":"2026-08-15T14:32:47.233941Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2606.29476","last_updated":"2026-06-28T16:11:47Z","snapshot_observed_at":"2026-08-14T02:03:49.084110Z","submitted_at":"2026-06-28T16:11:47Z","title":"CRAFT: Counterfactual Credit Assignment from Free Sibling Rollouts for Self-Distilled Agentic Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2606.29476","snapshot_observed_at":"2026-08-15T14:32:47.237322Z","title":"2606.29476 , archivePrefix =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.07371","last_updated":"2026-08-07T16:12:58Z","snapshot_observed_at":"2026-08-20T02:29:30.779952Z","submitted_at":"2026-08-07T16:12:58Z","title":"Trajectory-Relative Hindsight Distillation for Agentic Reinforcement Learning","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-15T14:32:47.237322Z"},"links":{"cited_paper":"/paper/2606.29476","citing_paper":"/paper/2608.07371"},"observation_digest":"sha256:96a2274e85f865d430d1f14095be694516b7e00586fa55545a362491e89059a8","observation_id":"77e4ed2d-77f4-48d5-801d-8fdba5c16bac","resolution":{"observed_at":"2026-08-15T14:32:47.237322Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2606.27814","last_updated":"2026-08-10T08:36:50Z","snapshot_observed_at":"2026-08-15T02:55:14.148507Z","submitted_at":"2026-06-26T07:56:32Z","title":"ATOD: Annealed Turn-Aware On-Policy Distillation for Multi-Turn Agentic Tasks","version":6},"cited_work":{"arxiv_id":"2606.27814","doi":"10.48550/arxiv.2606.27814","metadata_source":"pith","pith_arxiv_id":"2606.27814","snapshot_observed_at":"2026-08-15T18:16:14.067578Z","title":"ATOD: Annealed Turn-Aware On-Policy Distillation for Multi-Turn Agentic Tasks","venue":"cs.AI","work_id":"f2b851fb-74bb-49d4-ab15-29ac4b4210b1","year":2026},"citing_paper":{"arxiv_id":"2608.07371","last_updated":"2026-08-07T16:12:58Z","snapshot_observed_at":"2026-08-20T02:29:30.779952Z","submitted_at":"2026-08-07T16:12:58Z","title":"Trajectory-Relative Hindsight Distillation for Agentic Reinforcement Learning","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-15T14:32:47.240840Z"},"links":{"cited_paper":"/paper/2606.27814","citing_paper":"/paper/2608.07371"},"observation_digest":"sha256:e4ee8d4bdf39bb4beed882c9e5ef8b1a78e7e01e2bb03a300fc3eaf06626bdf7","observation_id":"5823c01d-e450-4f7d-936a-f8d519616ee6","resolution":{"observed_at":"2026-08-15T14:32:47.336865Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-17T18:38:15.522034+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-17T18:38:15.522034+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2606.19659","last_updated":"2026-06-17T23:58:14Z","snapshot_observed_at":"2026-08-19T12:38:21.344439Z","submitted_at":"2026-06-17T23:58:14Z","title":"SAGE-OPD: Selective Agent-Guided Intervention for Multi-Turn On-Policy Distillation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2606.19659","snapshot_observed_at":"2026-08-15T14:32:47.244217Z","title":"doi:10.48550/arXiv.2606.19659 , url =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.07371","last_updated":"2026-08-07T16:12:58Z","snapshot_observed_at":"2026-08-20T02:29:30.779952Z","submitted_at":"2026-08-07T16:12:58Z","title":"Trajectory-Relative Hindsight Distillation for Agentic Reinforcement Learning","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-15T14:32:47.244217Z"},"links":{"cited_paper":"/paper/2606.19659","citing_paper":"/paper/2608.07371"},"observation_digest":"sha256:e2727e99a1d3579f520aabc55c03dce10b9626c5924afee5333f01845c18f815","observation_id":"e3b83a2f-7ea5-4647-958d-16182753004f","resolution":{"observed_at":"2026-08-15T14:32:47.244217Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2607.05804","last_updated":"2026-07-07T03:56:35Z","snapshot_observed_at":"2026-08-16T13:49:03.913563Z","submitted_at":"2026-07-07T03:56:35Z","title":"TurnOPD: Making On-Policy Distillation Turn-Aware for Efficient Long-Horizon Agent Training","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2607.05804","snapshot_observed_at":"2026-08-15T14:32:47.247975Z","title":"2607.05804 , archivePrefix =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.07371","last_updated":"2026-08-07T16:12:58Z","snapshot_observed_at":"2026-08-20T02:29:30.779952Z","submitted_at":"2026-08-07T16:12:58Z","title":"Trajectory-Relative Hindsight Distillation for Agentic Reinforcement Learning","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-15T14:32:47.247975Z"},"links":{"cited_paper":"/paper/2607.05804","citing_paper":"/paper/2608.07371"},"observation_digest":"sha256:80344de79849628c380244e698de043145b2fdfbd610f7b05d14f086fba6d446","observation_id":"d74bd473-f4b2-426f-8612-6caf4e99b8ba","resolution":{"observed_at":"2026-08-15T14:32:47.247975Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:32:47.761270Z","title":"2021 , eprint =","venue":null,"work_id":"dfa24c1b-8d58-4e95-8c42-fbda0a126cf0","year":2021},"citing_paper":{"arxiv_id":"2608.07371","last_updated":"2026-08-07T16:12:58Z","snapshot_observed_at":"2026-08-20T02:29:30.779952Z","submitted_at":"2026-08-07T16:12:58Z","title":"Trajectory-Relative Hindsight Distillation for Agentic Reinforcement Learning","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-15T14:32:47.251571Z"},"links":{"citing_paper":"/paper/2608.07371"},"observation_digest":"sha256:1e45e7c92fe307489a8a6ab2925267c6f95ec3b24994f9de2cd31b3336fafa58","observation_id":"fdd59071-fe34-4b74-b6ba-4dc6288b7777","resolution":{"observed_at":"2026-08-15T14:32:47.764776Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:32:47.751077Z","title":"2022 , url =","venue":null,"work_id":"5f5730dd-ff56-45d0-9f95-f65928eeb81f","year":2022},"citing_paper":{"arxiv_id":"2608.07371","last_updated":"2026-08-07T16:12:58Z","snapshot_observed_at":"2026-08-20T02:29:30.779952Z","submitted_at":"2026-08-07T16:12:58Z","title":"Trajectory-Relative Hindsight Distillation for Agentic Reinforcement Learning","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-15T14:32:47.255143Z"},"links":{"citing_paper":"/paper/2608.07371"},"observation_digest":"sha256:f6d7a9613cae200a1e6db968b3885005ec6efcd2bb160ffe8abe7425da063496","observation_id":"4debe24c-edf4-44a9-84e5-b13ee961a9eb","resolution":{"observed_at":"2026-08-15T14:32:47.754518Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:32:47.741713Z","title":"2024 , eprint =","venue":null,"work_id":"0913b885-8c31-4d24-91ee-eb5d2caba852","year":2024},"citing_paper":{"arxiv_id":"2608.07371","last_updated":"2026-08-07T16:12:58Z","snapshot_observed_at":"2026-08-20T02:29:30.779952Z","submitted_at":"2026-08-07T16:12:58Z","title":"Trajectory-Relative Hindsight Distillation for Agentic Reinforcement Learning","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-15T14:32:47.258648Z"},"links":{"citing_paper":"/paper/2608.07371"},"observation_digest":"sha256:8f462d42e460ee29e2e58929ce8090e340e9df1dbb62dbb633d2458bfde0618c","observation_id":"4f4d4130-eaeb-44d1-a9bc-c22894d1521b","resolution":{"observed_at":"2026-08-15T14:32:47.744503Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:32:47.262158Z","title":"2025 , eprint =","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.07371","last_updated":"2026-08-07T16:12:58Z","snapshot_observed_at":"2026-08-20T02:29:30.779952Z","submitted_at":"2026-08-07T16:12:58Z","title":"Trajectory-Relative Hindsight Distillation for Agentic Reinforcement Learning","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-15T14:32:47.262158Z"},"links":{"citing_paper":"/paper/2608.07371"},"observation_digest":"sha256:e6d4a9368a18f8ebf4b6924f706c140b53336a8ffac2593ac76bae1a4f28f2c9","observation_id":"0f9e17d9-cb83-41f2-884e-ca019fbb0777","resolution":{"observed_at":"2026-08-15T14:32:47.262158Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:32:47.265583Z","title":"2017 , eprint =","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2608.07371","last_updated":"2026-08-07T16:12:58Z","snapshot_observed_at":"2026-08-20T02:29:30.779952Z","submitted_at":"2026-08-07T16:12:58Z","title":"Trajectory-Relative Hindsight Distillation for Agentic Reinforcement Learning","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-15T14:32:47.265583Z"},"links":{"citing_paper":"/paper/2608.07371"},"observation_digest":"sha256:4dc72862b7bed7363e94e97499314cd6242c43c19b6c1ecec5f14f94ed62794b","observation_id":"fb21a203-6dc1-4dfc-8b53-05e5b062ea59","resolution":{"observed_at":"2026-08-15T14:32:47.265583Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.00599","last_updated":"2025-03-25T08:10:15Z","snapshot_observed_at":"2026-08-13T01:52:55.412320Z","submitted_at":"2024-12-31T18:56:46Z","title":"VideoRefer Suite: Advancing Spatial-Temporal Object Understanding with Video LLM","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.00599","snapshot_observed_at":"2026-08-15T14:32:47.268646Z","title":"2501.00599 , archivePrefix =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.07371","last_updated":"2026-08-07T16:12:58Z","snapshot_observed_at":"2026-08-20T02:29:30.779952Z","submitted_at":"2026-08-07T16:12:58Z","title":"Trajectory-Relative Hindsight Distillation for Agentic Reinforcement Learning","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-15T14:32:47.268646Z"},"links":{"cited_paper":"/paper/2501.00599","citing_paper":"/paper/2608.07371"},"observation_digest":"sha256:49324d67a0959ecbe62f1832ef4fc920214835136e7337dc87f430a75558fb55","observation_id":"a70b3bff-5819-4816-b7e2-c691bcaf9183","resolution":{"observed_at":"2026-08-15T14:32:47.268646Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:32:47.272797Z","title":"2510.23603 , archivePrefix =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.07371","last_updated":"2026-08-07T16:12:58Z","snapshot_observed_at":"2026-08-20T02:29:30.779952Z","submitted_at":"2026-08-07T16:12:58Z","title":"Trajectory-Relative Hindsight Distillation for Agentic Reinforcement Learning","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-15T14:32:47.272797Z"},"links":{"citing_paper":"/paper/2608.07371"},"observation_digest":"sha256:ffa59a6b422d583dab56d89c06fa31cc161d4678e1441fef5b7a860a7373b487","observation_id":"ae0882d1-496a-4562-8be6-b1a4dcaf22aa","resolution":{"observed_at":"2026-08-15T14:32:47.272797Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.26102","last_updated":"2026-05-31T07:20:32Z","snapshot_observed_at":"2026-08-15T01:55:04.903017Z","submitted_at":"2026-05-25T17:58:03Z","title":"InstructSAM: Segment Any Instance with Any Instructions","version":2},"cited_work":{"arxiv_id":"2605.26102","doi":null,"metadata_source":"pith","pith_arxiv_id":"2605.26102","snapshot_observed_at":"2026-08-15T14:32:47.383917Z","title":"InstructSAM: Segment Any Instance with Any Instructions","venue":"cs.CV","work_id":"d7496456-a7da-4244-87bb-02d7a1faa815","year":2026},"citing_paper":{"arxiv_id":"2608.07371","last_updated":"2026-08-07T16:12:58Z","snapshot_observed_at":"2026-08-20T02:29:30.779952Z","submitted_at":"2026-08-07T16:12:58Z","title":"Trajectory-Relative Hindsight Distillation for Agentic Reinforcement Learning","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-15T14:32:47.275858Z"},"links":{"cited_paper":"/paper/2605.26102","citing_paper":"/paper/2608.07371"},"observation_digest":"sha256:91e673a176c54dfb1d85e9ffcf9e3d354aed43a9a334b3ee5fb68bad8cca9130","observation_id":"3d8b50da-c695-4d3d-accb-dcc189b748ef","resolution":{"observed_at":"2026-08-15T14:32:47.387496Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.13447","last_updated":"2024-03-20T09:42:43Z","snapshot_observed_at":"2026-08-16T14:08:06.107215Z","submitted_at":"2024-03-20T09:42:43Z","title":"HyperLLaVA: Dynamic Visual and Language Expert Tuning for Multimodal Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.13447","snapshot_observed_at":"2026-08-15T14:32:47.279314Z","title":"2403.13447 , archivePrefix =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.07371","last_updated":"2026-08-07T16:12:58Z","snapshot_observed_at":"2026-08-20T02:29:30.779952Z","submitted_at":"2026-08-07T16:12:58Z","title":"Trajectory-Relative Hindsight Distillation for Agentic Reinforcement Learning","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-15T14:32:47.279314Z"},"links":{"cited_paper":"/paper/2403.13447","citing_paper":"/paper/2608.07371"},"observation_digest":"sha256:004ce2b689f307cb2338b7994f90e638778e7a01b4fad905d52f64eb3ac8b8af","observation_id":"e6cf9bf9-8a6c-4b66-8880-d69a209ba3a9","resolution":{"observed_at":"2026-08-15T14:32:47.279314Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:32:47.717584Z","title":"2025 , url =","venue":null,"work_id":"4f8b7e8a-a0a4-4987-a9c5-0633cce9ad1e","year":2025},"citing_paper":{"arxiv_id":"2608.07371","last_updated":"2026-08-07T16:12:58Z","snapshot_observed_at":"2026-08-20T02:29:30.779952Z","submitted_at":"2026-08-07T16:12:58Z","title":"Trajectory-Relative Hindsight Distillation for Agentic Reinforcement Learning","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-15T14:32:47.282982Z"},"links":{"citing_paper":"/paper/2608.07371"},"observation_digest":"sha256:ccb1c31f92750111ea6abee39929b86ea0bfc0ad7366c33b9a44cee50795810f","observation_id":"fb9f8a0c-ff79-4004-9b1d-67eab96bef69","resolution":{"observed_at":"2026-08-15T14:32:47.721027Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2605.30011","last_updated":"2026-05-28T14:36:53Z","snapshot_observed_at":"2026-08-14T22:48:59.292649Z","submitted_at":"2026-05-28T14:36:53Z","title":"VisualThink-VLA: Visual Intermediate Reasoning for Effective and Low-Latency Vision-Language-Action Policies","version":1},"cited_work":{"arxiv_id":"2605.30011","doi":null,"metadata_source":"pith","pith_arxiv_id":"2605.30011","snapshot_observed_at":"2026-08-15T14:32:47.358113Z","title":"VisualThink-VLA: Visual Intermediate Reasoning for Effective and Low-Latency Vision-Language-Action Policies","venue":"cs.CV","work_id":"c785e745-ca94-422b-87f3-5ee005569dde","year":2026},"citing_paper":{"arxiv_id":"2608.07371","last_updated":"2026-08-07T16:12:58Z","snapshot_observed_at":"2026-08-20T02:29:30.779952Z","submitted_at":"2026-08-07T16:12:58Z","title":"Trajectory-Relative Hindsight Distillation for Agentic Reinforcement Learning","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-15T14:32:47.286487Z"},"links":{"cited_paper":"/paper/2605.30011","citing_paper":"/paper/2608.07371"},"observation_digest":"sha256:df98cdcbe33c65880aaf16a9f34c17975c9c0286513f3942d379bdbba643b83d","observation_id":"185b5178-ac17-4822-a8ed-223a8c273ce1","resolution":{"observed_at":"2026-08-15T14:32:47.362059Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:32:47.707233Z","title":null,"venue":null,"work_id":"34934ad9-c51c-47d4-8b77-11e46c35d772","year":null},"citing_paper":{"arxiv_id":"2608.07371","last_updated":"2026-08-07T16:12:58Z","snapshot_observed_at":"2026-08-20T02:29:30.779952Z","submitted_at":"2026-08-07T16:12:58Z","title":"Trajectory-Relative Hindsight Distillation for Agentic Reinforcement Learning","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-15T14:32:47.290687Z"},"links":{"citing_paper":"/paper/2608.07371"},"observation_digest":"sha256:26e0d037db7234aa4b9950999bdec97ba0104cac6694aff1c22d6117d21932e1","observation_id":"85e9fcbd-71ac-4e3f-89fb-feff40384c9a","resolution":{"observed_at":"2026-08-15T14:32:47.710479Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2608.07371","last_updated":"2026-08-07T16:12:58Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-20T02:29:30.779952Z","submitted_at":"2026-08-07T16:12:58Z","title":"Trajectory-Relative Hindsight Distillation for Agentic Reinforcement Learning"},"reference_resolution":{"displayed":39,"state_counts":{"malformed_identifier":0,"metadata_mismatch":4,"parse_uncertain":0,"unresolved":28,"verified_exact":1,"verified_fuzzy":6},"total_outbound_references":39},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"thesis":"As of 20 August 2026, this Paper Citation Record lists 39 of 39 outbound references and 0 inbound Pith citation observations for arXiv:2608.07371."}