{"as_of":"2026-08-21T18:47:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:30980b1517f005b51301a7ad72a1b5ab9003d025916dc0195b046c68901cd03b","coverage":[{"denominator":46,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":46,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T14:06:58.046928Z","state":"measured"},{"denominator":48,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":48,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-21T06:32:19.484+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-26T21:10:47.294719Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T00:29:16.281906Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.20023","last_updated":"2025-05-26T14:11:12Z","snapshot_observed_at":"2026-08-16T13:28:40.997677Z","submitted_at":"2025-05-26T14:11:12Z","title":"Training LLM-Based Agents with Synthetic Self-Reflected Trajectories and Partial Masking","version":1},"cited_work":{"arxiv_id":"2505.20023","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.20023","snapshot_observed_at":"2026-07-04T00:29:16.281906Z","title":"arXiv preprint arXiv:2505.20023 , year=","venue":null,"work_id":"a650cfa6-43bf-46bb-8c20-bc5249d21397","year":null},"citing_paper":{"arxiv_id":"2605.10674","last_updated":"2026-05-11T14:55:20Z","snapshot_observed_at":"2026-08-21T03:33:05.564102Z","submitted_at":"2026-05-11T14:55:20Z","title":"Step Rejection Fine-Tuning: A Practical Distillation Recipe","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-05-12T03:44:33.525966Z"},"links":{"cited_paper":"/paper/2505.20023","citing_paper":"/paper/2605.10674"},"observation_digest":"sha256:f3c0b35287a6a0a12ff4e9bcb55f6b493b79ce9723a5aa1a941565c122942b57","observation_id":"7bb4b43e-7867-4e7c-a441-d1d3a44ea4b7","resolution":{"observed_at":"2026-05-12T07:06:35.477603Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.20023","last_updated":"2025-05-26T14:11:12Z","snapshot_observed_at":"2026-08-16T13:28:40.997677Z","submitted_at":"2025-05-26T14:11:12Z","title":"Training LLM-Based Agents with Synthetic Self-Reflected Trajectories and Partial Masking","version":1},"cited_work":{"arxiv_id":"2505.20023","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.20023","snapshot_observed_at":"2026-07-04T00:29:16.281906Z","title":"arXiv preprint arXiv:2505.20023 , year=","venue":null,"work_id":"a650cfa6-43bf-46bb-8c20-bc5249d21397","year":null},"citing_paper":{"arxiv_id":"2606.18890","last_updated":"2026-06-17T10:07:51Z","snapshot_observed_at":"2026-08-01T16:18:21.983276Z","submitted_at":"2026-06-17T10:07:51Z","title":"Skill-Guided Continuation Distillation for GUI Agents","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-06-26T21:10:47.294719Z"},"links":{"cited_paper":"/paper/2505.20023","citing_paper":"/paper/2606.18890"},"observation_digest":"sha256:c7926056523a83b65ace2d30886705516888d300e64a705964ab9b166efff7a8","observation_id":"79797b27-9d58-4d06-9879-8161996593c9","resolution":{"observed_at":"2026-07-04T00:29:16.284966Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2505.20023/citation-record","integrity":"/paper/2505.20023/integrity","json":"/paper/2505.20023/citation-record.json","paper":"/paper/2505.20023"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2309.16609","last_updated":"2023-09-28T17:07:49Z","snapshot_observed_at":"2026-08-20T15:31:01.041088Z","submitted_at":"2023-09-28T17:07:49Z","title":"Qwen Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.16609","snapshot_observed_at":"2026-08-07T14:06:53.542880Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.20023","last_updated":"2025-05-26T14:11:12Z","snapshot_observed_at":"2026-08-16T13:28:40.997677Z","submitted_at":"2025-05-26T14:11:12Z","title":"Training LLM-Based Agents with Synthetic Self-Reflected Trajectories and Partial Masking","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-07T14:06:53.542880Z"},"links":{"cited_paper":"/paper/2309.16609","citing_paper":"/paper/2505.20023"},"observation_digest":"sha256:7308c13653ab617b8e41d933aeb5552e02d58c0b0d485c5eb896cf2d1772a85f","observation_id":"e1f5a3cb-f22d-44c6-96b2-3e9d125e437b","resolution":{"observed_at":"2026-08-07T14:06:53.542880Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:06:53.607520Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.20023","last_updated":"2025-05-26T14:11:12Z","snapshot_observed_at":"2026-08-16T13:28:40.997677Z","submitted_at":"2025-05-26T14:11:12Z","title":"Training LLM-Based Agents with Synthetic Self-Reflected Trajectories and Partial Masking","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-07T14:06:53.607520Z"},"links":{"citing_paper":"/paper/2505.20023"},"observation_digest":"sha256:26d0cea2d4ff47559e6d274883c642e978452c8dd2532b2533cb7d6c603bdc21","observation_id":"3a63268d-fe89-4237-8d65-9cffcf568265","resolution":{"observed_at":"2026-08-07T14:06:53.607520Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.05915","last_updated":"2023-10-09T17:58:38Z","snapshot_observed_at":"2026-08-16T14:53:43.494263Z","submitted_at":"2023-10-09T17:58:38Z","title":"FireAct: Toward Language Agent Fine-tuning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.05915","snapshot_observed_at":"2026-08-07T14:06:53.740452Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.20023","last_updated":"2025-05-26T14:11:12Z","snapshot_observed_at":"2026-08-16T13:28:40.997677Z","submitted_at":"2025-05-26T14:11:12Z","title":"Training LLM-Based Agents with Synthetic Self-Reflected Trajectories and Partial Masking","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-07T14:06:53.740452Z"},"links":{"cited_paper":"/paper/2310.05915","citing_paper":"/paper/2505.20023"},"observation_digest":"sha256:b9cedf13ec3e73e566fb97caadc48391a57f2b65774e1461daacb420f14f452d","observation_id":"24ba30b1-3a1a-4744-9b32-ffb030550847","resolution":{"observed_at":"2026-08-07T14:06:53.740452Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1080/019697297126029","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T05:30:23.456663Z","title":null,"venue":"Cybernetics & Systems","work_id":"d35c5901-7a2c-4caa-a3f4-f37afa35bd67","year":1997},"citing_paper":{"arxiv_id":"2505.20023","last_updated":"2025-05-26T14:11:12Z","snapshot_observed_at":"2026-08-16T13:28:40.997677Z","submitted_at":"2025-05-26T14:11:12Z","title":"Training LLM-Based Agents with Synthetic Self-Reflected Trajectories and Partial Masking","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-07T14:06:53.802374Z"},"links":{"citing_paper":"/paper/2505.20023"},"observation_digest":"sha256:c45f806cf3ca612aa5998cc8e0bde1950b94cc792e437a9a7b66108ac86ca127","observation_id":"0d46e696-3574-4da1-b540-ffe9b24aa833","resolution":{"observed_at":"2026-08-07T14:06:58.160732Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.13009","last_updated":"2024-10-10T11:51:24Z","snapshot_observed_at":"2026-08-17T23:43:57.880609Z","submitted_at":"2024-05-13T10:51:43Z","title":"MetaReflection: Learning Instructions for Language Agents using Past Reflections","version":2},"cited_work":{"arxiv_id":"2405.13009","doi":null,"metadata_source":"pith","pith_arxiv_id":"2405.13009","snapshot_observed_at":"2026-08-07T14:06:58.868778Z","title":"MetaReflection: Learning Instructions for Language Agents using Past Reflections","venue":"cs.CL","work_id":"c2e1fcc6-ea9a-4f39-b6d5-34031831db4d","year":2024},"citing_paper":{"arxiv_id":"2505.20023","last_updated":"2025-05-26T14:11:12Z","snapshot_observed_at":"2026-08-16T13:28:40.997677Z","submitted_at":"2025-05-26T14:11:12Z","title":"Training LLM-Based Agents with Synthetic Self-Reflected Trajectories and Partial Masking","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-07T14:06:53.976310Z"},"links":{"cited_paper":"/paper/2405.13009","citing_paper":"/paper/2505.20023"},"observation_digest":"sha256:787b23a85fcf626cd500636fdcfdab853debb975d2b00fb5a925ff6edd29fc3d","observation_id":"e4d565e5-85eb-4ed4-b3d9-3d5854439c1d","resolution":{"observed_at":"2026-08-07T14:06:58.925514Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:07:01.858530Z","title":null,"venue":null,"work_id":"f659a530-ebb9-4f7f-b68c-9dfc05e6ad11","year":2024},"citing_paper":{"arxiv_id":"2505.20023","last_updated":"2025-05-26T14:11:12Z","snapshot_observed_at":"2026-08-16T13:28:40.997677Z","submitted_at":"2025-05-26T14:11:12Z","title":"Training LLM-Based Agents with Synthetic Self-Reflected Trajectories and Partial Masking","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-07T14:06:54.092619Z"},"links":{"citing_paper":"/paper/2505.20023"},"observation_digest":"sha256:28d189a0126f9af231fb81971d71aa055c7864afeb7f4feb0570c16bf50ae74a","observation_id":"9e4bdf35-c8bd-46f1-924f-865297a22088","resolution":{"observed_at":"2026-08-07T14:07:01.907615Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06825","last_updated":"2023-10-10T17:54:58Z","snapshot_observed_at":"2026-08-17T20:30:34.016254Z","submitted_at":"2023-10-10T17:54:58Z","title":"Mistral 7B","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06825","snapshot_observed_at":"2026-08-07T14:06:54.218467Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.20023","last_updated":"2025-05-26T14:11:12Z","snapshot_observed_at":"2026-08-16T13:28:40.997677Z","submitted_at":"2025-05-26T14:11:12Z","title":"Training LLM-Based Agents with Synthetic Self-Reflected Trajectories and Partial Masking","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-07T14:06:54.218467Z"},"links":{"cited_paper":"/paper/2310.06825","citing_paper":"/paper/2505.20023"},"observation_digest":"sha256:c8029d7390809033038c2a3eb66cd81498fa38e5cf43c470c8e51dfd31fa26c1","observation_id":"2b9ead3b-4938-45cd-b365-a3052cf44fc1","resolution":{"observed_at":"2026-08-07T14:06:54.218467Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:06:54.388547Z","title":"Gonzalez, Hao Zhang, and Ion Stoica","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.20023","last_updated":"2025-05-26T14:11:12Z","snapshot_observed_at":"2026-08-16T13:28:40.997677Z","submitted_at":"2025-05-26T14:11:12Z","title":"Training LLM-Based Agents with Synthetic Self-Reflected Trajectories and Partial Masking","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-07T14:06:54.388547Z"},"links":{"citing_paper":"/paper/2505.20023"},"observation_digest":"sha256:098efd028edfc97b54d736c3f713b01b773ce6665b52204ee65dbc795ace1e6d","observation_id":"1ab24e4c-74e9-4657-ae12-e0e1e9ed8206","resolution":{"observed_at":"2026-08-07T14:06:54.388547Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:07:01.666195Z","title":null,"venue":null,"work_id":"22c551b4-bb65-4f20-87ef-b6851c5e1cf8","year":2023},"citing_paper":{"arxiv_id":"2505.20023","last_updated":"2025-05-26T14:11:12Z","snapshot_observed_at":"2026-08-16T13:28:40.997677Z","submitted_at":"2025-05-26T14:11:12Z","title":"Training LLM-Based Agents with Synthetic Self-Reflected Trajectories and Partial Masking","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-07T14:06:54.441432Z"},"links":{"citing_paper":"/paper/2505.20023"},"observation_digest":"sha256:b520fa847a3c91f1a442f07feb964c5cb1a68177101e00d3fb5ff92e1ebbcb52","observation_id":"406c1c69-051f-4f4b-8125-bd141f0051fb","resolution":{"observed_at":"2026-08-07T14:07:01.763957Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:07:01.479348Z","title":null,"venue":null,"work_id":"cd5eb686-2df0-46a9-a783-f372cf30cda3","year":2024},"citing_paper":{"arxiv_id":"2505.20023","last_updated":"2025-05-26T14:11:12Z","snapshot_observed_at":"2026-08-16T13:28:40.997677Z","submitted_at":"2025-05-26T14:11:12Z","title":"Training LLM-Based Agents with Synthetic Self-Reflected Trajectories and Partial Masking","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-07T14:06:54.489782Z"},"links":{"citing_paper":"/paper/2505.20023"},"observation_digest":"sha256:f38aa4b4750ef0e6457ae013fdefa1b9c0a1ed17e8b126e533707a44f104304f","observation_id":"757251c9-9c98-43b8-9cf1-d81d0a2691b3","resolution":{"observed_at":"2026-08-07T14:07:01.551294Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:06:54.554746Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.20023","last_updated":"2025-05-26T14:11:12Z","snapshot_observed_at":"2026-08-16T13:28:40.997677Z","submitted_at":"2025-05-26T14:11:12Z","title":"Training LLM-Based Agents with Synthetic Self-Reflected Trajectories and Partial Masking","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-07T14:06:54.554746Z"},"links":{"citing_paper":"/paper/2505.20023"},"observation_digest":"sha256:b1e175e4ea568b5d04791b98049b3d7cd49196af29e97d9892b887cfd6e628b1","observation_id":"4e14beec-d708-4d71-a7e0-f43a78fb9a89","resolution":{"observed_at":"2026-08-07T14:06:54.554746Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:07:01.241384Z","title":null,"venue":null,"work_id":"cae34c9d-6c8e-4978-8a7a-15f2b6c4e4b2","year":2024},"citing_paper":{"arxiv_id":"2505.20023","last_updated":"2025-05-26T14:11:12Z","snapshot_observed_at":"2026-08-16T13:28:40.997677Z","submitted_at":"2025-05-26T14:11:12Z","title":"Training LLM-Based Agents with Synthetic Self-Reflected Trajectories and Partial Masking","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-07T14:06:54.656431Z"},"links":{"citing_paper":"/paper/2505.20023"},"observation_digest":"sha256:17cd5ec947bc9732b45bda08e22ce41267b184e7492d5a13f8e12d43314f6bc6","observation_id":"75b55fe6-d004-4668-904a-239f9340e374","resolution":{"observed_at":"2026-08-07T14:07:01.354584Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:07:00.950431Z","title":null,"venue":null,"work_id":"7d98a8f6-2e2c-41af-b40f-d8cd039fcc62","year":2024},"citing_paper":{"arxiv_id":"2505.20023","last_updated":"2025-05-26T14:11:12Z","snapshot_observed_at":"2026-08-16T13:28:40.997677Z","submitted_at":"2025-05-26T14:11:12Z","title":"Training LLM-Based Agents with Synthetic Self-Reflected Trajectories and Partial Masking","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-07T14:06:54.714515Z"},"links":{"citing_paper":"/paper/2505.20023"},"observation_digest":"sha256:9ac08788705e77e1ab0ac342ca6e0b0088bf03ea2b63d8610223ee654afff545","observation_id":"6fb5fb70-ec4a-4479-a0c8-1b453ea29951","resolution":{"observed_at":"2026-08-07T14:07:01.065647Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-17T09:58:46.058102Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-07T14:06:54.770766Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20023","last_updated":"2025-05-26T14:11:12Z","snapshot_observed_at":"2026-08-16T13:28:40.997677Z","submitted_at":"2025-05-26T14:11:12Z","title":"Training LLM-Based Agents with Synthetic Self-Reflected Trajectories and Partial Masking","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-07T14:06:54.770766Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2505.20023"},"observation_digest":"sha256:68a4eb1071899e4d6bee3ce626c0f465630447dc9f466b0c554bedf9e004c35d","observation_id":"ffbdea23-f3db-4bb2-95ea-00186e66ee8a","resolution":{"observed_at":"2026-08-07T14:06:54.770766Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:07:00.642476Z","title":null,"venue":null,"work_id":"f4e71494-88bc-4a25-a154-d9c314c1157b","year":2024},"citing_paper":{"arxiv_id":"2505.20023","last_updated":"2025-05-26T14:11:12Z","snapshot_observed_at":"2026-08-16T13:28:40.997677Z","submitted_at":"2025-05-26T14:11:12Z","title":"Training LLM-Based Agents with Synthetic Self-Reflected Trajectories and Partial Masking","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-07T14:06:54.826679Z"},"links":{"citing_paper":"/paper/2505.20023"},"observation_digest":"sha256:754818ec59b19188a7c67d6858155f97d03fd31da1fad1da50d90ce7ee322701","observation_id":"8bca7f86-6c69-4f16-a6a4-4421f59280f6","resolution":{"observed_at":"2026-08-07T14:07:00.778903Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.15334","last_updated":"2023-05-24T16:48:11Z","snapshot_observed_at":"2026-08-20T10:31:15.813764Z","submitted_at":"2023-05-24T16:48:11Z","title":"Gorilla: Large Language Model Connected with Massive APIs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.15334","snapshot_observed_at":"2026-08-07T14:06:54.892244Z","title":"Patil, Tianjun Zhang, Xin Wang, and Joseph E","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.20023","last_updated":"2025-05-26T14:11:12Z","snapshot_observed_at":"2026-08-16T13:28:40.997677Z","submitted_at":"2025-05-26T14:11:12Z","title":"Training LLM-Based Agents with Synthetic Self-Reflected Trajectories and Partial Masking","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-07T14:06:54.892244Z"},"links":{"cited_paper":"/paper/2305.15334","citing_paper":"/paper/2505.20023"},"observation_digest":"sha256:f64a20df40eb7229d8769fe966f9a2e7d4f38d15add66f16045a9deda90b8dc2","observation_id":"888df397-25b2-4a4d-a86c-ac99790d5902","resolution":{"observed_at":"2026-08-07T14:06:54.892244Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.12813","last_updated":"2023-03-08T23:41:49Z","snapshot_observed_at":"2026-08-16T13:28:02.541688Z","submitted_at":"2023-02-24T18:48:43Z","title":"Check Your Facts and Try Again: Improving Large Language Models with External Knowledge and Automated Feedback","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.12813","snapshot_observed_at":"2026-08-07T14:06:54.946192Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.20023","last_updated":"2025-05-26T14:11:12Z","snapshot_observed_at":"2026-08-16T13:28:40.997677Z","submitted_at":"2025-05-26T14:11:12Z","title":"Training LLM-Based Agents with Synthetic Self-Reflected Trajectories and Partial Masking","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-07T14:06:54.946192Z"},"links":{"cited_paper":"/paper/2302.12813","citing_paper":"/paper/2505.20023"},"observation_digest":"sha256:b0facbe750569706cef0b692674ecf596cf5fa481fd9a8e704e464525d170b24","observation_id":"0cbbb406-f128-42c1-96e6-43677a2d47c9","resolution":{"observed_at":"2026-08-07T14:06:54.946192Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:06:55.027332Z","title":"Pomerleau","venue":null,"work_id":null,"year":1991},"citing_paper":{"arxiv_id":"2505.20023","last_updated":"2025-05-26T14:11:12Z","snapshot_observed_at":"2026-08-16T13:28:40.997677Z","submitted_at":"2025-05-26T14:11:12Z","title":"Training LLM-Based Agents with Synthetic Self-Reflected Trajectories and Partial Masking","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-07T14:06:55.027332Z"},"links":{"citing_paper":"/paper/2505.20023"},"observation_digest":"sha256:9427a3f131bb9a6c48004b89cae2c3ce8d107b6a90cd581331d55632e1756a52","observation_id":"cb4b500d-1b40-4b92-abe8-e355c20f6bff","resolution":{"observed_at":"2026-08-07T14:06:55.027332Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.13996","last_updated":"2024-01-25T07:47:49Z","snapshot_observed_at":"2026-08-16T14:24:39.196370Z","submitted_at":"2024-01-25T07:47:49Z","title":"Investigate-Consolidate-Exploit: A General Strategy for Inter-Task Agent Self-Evolution","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.13996","snapshot_observed_at":"2026-08-07T14:06:55.122909Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20023","last_updated":"2025-05-26T14:11:12Z","snapshot_observed_at":"2026-08-16T13:28:40.997677Z","submitted_at":"2025-05-26T14:11:12Z","title":"Training LLM-Based Agents with Synthetic Self-Reflected Trajectories and Partial Masking","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-07T14:06:55.122909Z"},"links":{"cited_paper":"/paper/2401.13996","citing_paper":"/paper/2505.20023"},"observation_digest":"sha256:a79f97a26e3a5b95b4b0ba24fb38a7182fde2426f834be9718ac7782fff5a949","observation_id":"071d1a47-6753-47da-871d-9e4e3d31fdfe","resolution":{"observed_at":"2026-08-07T14:06:55.122909Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.14205","last_updated":"2025-01-03T16:44:55Z","snapshot_observed_at":"2026-08-18T18:29:50.283045Z","submitted_at":"2024-05-23T06:03:19Z","title":"Agent Planning with World Knowledge Model","version":4},"cited_work":{"arxiv_id":"2405.14205","doi":null,"metadata_source":"pith","pith_arxiv_id":"2405.14205","snapshot_observed_at":"2026-08-07T14:06:58.557897Z","title":"Agent Planning with World Knowledge Model","venue":"cs.CL","work_id":"98e551ec-5ac0-4aaa-bf45-dd30a3354fb5","year":2024},"citing_paper":{"arxiv_id":"2505.20023","last_updated":"2025-05-26T14:11:12Z","snapshot_observed_at":"2026-08-16T13:28:40.997677Z","submitted_at":"2025-05-26T14:11:12Z","title":"Training LLM-Based Agents with Synthetic Self-Reflected Trajectories and Partial Masking","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-07T14:06:55.286037Z"},"links":{"cited_paper":"/paper/2405.14205","citing_paper":"/paper/2505.20023"},"observation_digest":"sha256:02622ae87c687fe3a5095e79168020c9b14e8beb95d7579338c8cc78fcee35aa","observation_id":"7e3097b8-42e0-4449-afa7-5b8a10a5948a","resolution":{"observed_at":"2026-08-07T14:06:58.636606Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:07:00.372425Z","title":null,"venue":null,"work_id":"729f66c9-f938-41cf-86b5-960de6fb7930","year":2024},"citing_paper":{"arxiv_id":"2505.20023","last_updated":"2025-05-26T14:11:12Z","snapshot_observed_at":"2026-08-16T13:28:40.997677Z","submitted_at":"2025-05-26T14:11:12Z","title":"Training LLM-Based Agents with Synthetic Self-Reflected Trajectories and Partial Masking","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-07T14:06:55.459964Z"},"links":{"citing_paper":"/paper/2505.20023"},"observation_digest":"sha256:e925c725049c47a592f5f46f10f449094adde552f7fdea8fbb620cd412c4346f","observation_id":"72568008-c0ef-4cea-89f8-09089843e5b9","resolution":{"observed_at":"2026-08-07T14:07:00.508858Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:06:55.635862Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20023","last_updated":"2025-05-26T14:11:12Z","snapshot_observed_at":"2026-08-16T13:28:40.997677Z","submitted_at":"2025-05-26T14:11:12Z","title":"Training LLM-Based Agents with Synthetic Self-Reflected Trajectories and Partial Masking","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-07T14:06:55.635862Z"},"links":{"citing_paper":"/paper/2505.20023"},"observation_digest":"sha256:186f2e8a7faaa08bb6f89910a9fc849ea9e20a83f5bcda68a5864fb7e92b84e2","observation_id":"48cd31e4-9195-4630-ad83-6bcd65afde44","resolution":{"observed_at":"2026-08-07T14:06:55.635862Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:06:55.754994Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.20023","last_updated":"2025-05-26T14:11:12Z","snapshot_observed_at":"2026-08-16T13:28:40.997677Z","submitted_at":"2025-05-26T14:11:12Z","title":"Training LLM-Based Agents with Synthetic Self-Reflected Trajectories and Partial Masking","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-07T14:06:55.754994Z"},"links":{"citing_paper":"/paper/2505.20023"},"observation_digest":"sha256:b66821ba27604ae7e00e997865e6f3defabad58bb9f2c90d46e31569fc5a607f","observation_id":"b11fc6e9-91c9-4190-8d61-1783208b8330","resolution":{"observed_at":"2026-08-07T14:06:55.754994Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:06:59.982355Z","title":null,"venue":null,"work_id":"50e7d759-d764-4b3b-bfdc-bb000b443078","year":2020},"citing_paper":{"arxiv_id":"2505.20023","last_updated":"2025-05-26T14:11:12Z","snapshot_observed_at":"2026-08-16T13:28:40.997677Z","submitted_at":"2025-05-26T14:11:12Z","title":"Training LLM-Based Agents with Synthetic Self-Reflected Trajectories and Partial Masking","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-07T14:06:55.881097Z"},"links":{"citing_paper":"/paper/2505.20023"},"observation_digest":"sha256:baadd1e3eb15e78d69a5aa94428253572e7299f5aee74c8d591d247462fcf527","observation_id":"9aee5b8c-0670-4752-8204-ac0065f682ea","resolution":{"observed_at":"2026-08-07T14:07:00.132607Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2010.03768","last_updated":"2021-03-14T22:44:38Z","snapshot_observed_at":"2026-08-19T18:51:42.906395Z","submitted_at":"2020-10-08T05:13:36Z","title":"ALFWorld: Aligning Text and Embodied Environments for Interactive Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.03768","snapshot_observed_at":"2026-08-07T14:06:56.016515Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.20023","last_updated":"2025-05-26T14:11:12Z","snapshot_observed_at":"2026-08-16T13:28:40.997677Z","submitted_at":"2025-05-26T14:11:12Z","title":"Training LLM-Based Agents with Synthetic Self-Reflected Trajectories and Partial Masking","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-07T14:06:56.016515Z"},"links":{"cited_paper":"/paper/2010.03768","citing_paper":"/paper/2505.20023"},"observation_digest":"sha256:e211da9e456acdce2b8d35c6b67a4613016f9e38255d82df46c1cc3e040306a8","observation_id":"99913d9f-e9dc-4951-824b-dcc62d59a377","resolution":{"observed_at":"2026-08-07T14:06:56.016515Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.02502","last_updated":"2024-07-10T17:36:25Z","snapshot_observed_at":"2026-08-16T14:12:52.561838Z","submitted_at":"2024-03-04T21:50:29Z","title":"Trial and Error: Exploration-Based Trajectory Optimization for LLM Agents","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.02502","snapshot_observed_at":"2026-08-07T14:06:56.135534Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20023","last_updated":"2025-05-26T14:11:12Z","snapshot_observed_at":"2026-08-16T13:28:40.997677Z","submitted_at":"2025-05-26T14:11:12Z","title":"Training LLM-Based Agents with Synthetic Self-Reflected Trajectories and Partial Masking","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-07T14:06:56.135534Z"},"links":{"cited_paper":"/paper/2403.02502","citing_paper":"/paper/2505.20023"},"observation_digest":"sha256:fe12d69634d407dc1675a998db23a8c5e057eb6c34eab0706c02d13de7ef7424","observation_id":"4221ee65-8241-4637-aca8-a09a0be48bff","resolution":{"observed_at":"2026-08-07T14:06:56.135534Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-07T14:06:56.286740Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.20023","last_updated":"2025-05-26T14:11:12Z","snapshot_observed_at":"2026-08-16T13:28:40.997677Z","submitted_at":"2025-05-26T14:11:12Z","title":"Training LLM-Based Agents with Synthetic Self-Reflected Trajectories and Partial Masking","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-07T14:06:56.286740Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2505.20023"},"observation_digest":"sha256:e4c3644c25dce17b2e0dbbb7f607d29dff03a73bb47d418b1319d69c32ea94a2","observation_id":"d7d1b60b-1ed6-413d-9c94-9611c613c178","resolution":{"observed_at":"2026-08-07T14:06:56.286740Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:06:56.421739Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20023","last_updated":"2025-05-26T14:11:12Z","snapshot_observed_at":"2026-08-16T13:28:40.997677Z","submitted_at":"2025-05-26T14:11:12Z","title":"Training LLM-Based Agents with Synthetic Self-Reflected Trajectories and Partial Masking","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-07T14:06:56.421739Z"},"links":{"citing_paper":"/paper/2505.20023"},"observation_digest":"sha256:d10821360565c8cdd6765feb0e7acf1fbbf619221f89db9372a0ef314d5f72b3","observation_id":"d25f5d6d-e68c-42c1-8267-708035f0f542","resolution":{"observed_at":"2026-08-07T14:06:56.421739Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.11651","last_updated":"2024-04-16T11:41:13Z","snapshot_observed_at":"2026-08-18T18:36:45.702555Z","submitted_at":"2024-02-18T17:10:07Z","title":"Learning From Failure: Integrating Negative Examples when Fine-tuning Large Language Models as Agents","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.11651","snapshot_observed_at":"2026-08-07T14:06:56.596041Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20023","last_updated":"2025-05-26T14:11:12Z","snapshot_observed_at":"2026-08-16T13:28:40.997677Z","submitted_at":"2025-05-26T14:11:12Z","title":"Training LLM-Based Agents with Synthetic Self-Reflected Trajectories and Partial Masking","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-07T14:06:56.596041Z"},"links":{"cited_paper":"/paper/2402.11651","citing_paper":"/paper/2505.20023"},"observation_digest":"sha256:7061be6c89dc70f320d48f7e342bc50a0cf2108f895caf1097819f275a0da80b","observation_id":"6019eb82-e0fa-4fa5-b0a3-d7dce12e2c28","resolution":{"observed_at":"2026-08-07T14:06:56.596041Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:06:56.750118Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.20023","last_updated":"2025-05-26T14:11:12Z","snapshot_observed_at":"2026-08-16T13:28:40.997677Z","submitted_at":"2025-05-26T14:11:12Z","title":"Training LLM-Based Agents with Synthetic Self-Reflected Trajectories and Partial Masking","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-07T14:06:56.750118Z"},"links":{"citing_paper":"/paper/2505.20023"},"observation_digest":"sha256:137e0f65999a4d26f1e0daa56bc28ae2a9ed023acbf2ec8b2e8a28ed98451745","observation_id":"f965e53c-b660-42e4-b5e4-f2361f908ad4","resolution":{"observed_at":"2026-08-07T14:06:56.750118Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:06:56.919405Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.20023","last_updated":"2025-05-26T14:11:12Z","snapshot_observed_at":"2026-08-16T13:28:40.997677Z","submitted_at":"2025-05-26T14:11:12Z","title":"Training LLM-Based Agents with Synthetic Self-Reflected Trajectories and Partial Masking","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-07T14:06:56.919405Z"},"links":{"citing_paper":"/paper/2505.20023"},"observation_digest":"sha256:b23846ecbffeb8ed3679ddb0a48a1d2fdc1bc8e9481b68f6e77c07a8830fbd04","observation_id":"5b8306be-aec0-40e0-9765-ce942e2a0e84","resolution":{"observed_at":"2026-08-07T14:06:56.919405Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.07864","last_updated":"2023-09-19T08:29:18Z","snapshot_observed_at":"2026-08-17T06:15:32.510873Z","submitted_at":"2023-09-14T17:12:03Z","title":"The Rise and Potential of Large Language Model Based Agents: A Survey","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.07864","snapshot_observed_at":"2026-08-07T14:06:57.038198Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.20023","last_updated":"2025-05-26T14:11:12Z","snapshot_observed_at":"2026-08-16T13:28:40.997677Z","submitted_at":"2025-05-26T14:11:12Z","title":"Training LLM-Based Agents with Synthetic Self-Reflected Trajectories and Partial Masking","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-07T14:06:57.038198Z"},"links":{"cited_paper":"/paper/2309.07864","citing_paper":"/paper/2505.20023"},"observation_digest":"sha256:30b16840a8dfcdf69507d20627d5cbe8f89726daf5c3f638079d860bd7d6d1f4","observation_id":"af1016af-ef86-445a-bf1e-29a5cdf44b79","resolution":{"observed_at":"2026-08-07T14:06:57.038198Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04151","last_updated":"2024-06-06T15:15:41Z","snapshot_observed_at":"2026-08-16T13:45:29.257000Z","submitted_at":"2024-06-06T15:15:41Z","title":"AgentGym: Evolving Large Language Model-based Agents across Diverse Environments","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.04151","snapshot_observed_at":"2026-08-07T14:06:57.158038Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20023","last_updated":"2025-05-26T14:11:12Z","snapshot_observed_at":"2026-08-16T13:28:40.997677Z","submitted_at":"2025-05-26T14:11:12Z","title":"Training LLM-Based Agents with Synthetic Self-Reflected Trajectories and Partial Masking","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-07T14:06:57.158038Z"},"links":{"cited_paper":"/paper/2406.04151","citing_paper":"/paper/2505.20023"},"observation_digest":"sha256:51bc43ccf1ef87d915a20bfd5d3855f825389920dc64cd0f0223cfa55be38fd2","observation_id":"316f7091-e032-42dd-ac81-1b3f3a273f74","resolution":{"observed_at":"2026-08-07T14:06:57.158038Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:06:59.752492Z","title":null,"venue":null,"work_id":"61686303-7372-4abe-8cdb-1f36b5eae785","year":2024},"citing_paper":{"arxiv_id":"2505.20023","last_updated":"2025-05-26T14:11:12Z","snapshot_observed_at":"2026-08-16T13:28:40.997677Z","submitted_at":"2025-05-26T14:11:12Z","title":"Training LLM-Based Agents with Synthetic Self-Reflected Trajectories and Partial Masking","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-07T14:06:57.320294Z"},"links":{"citing_paper":"/paper/2505.20023"},"observation_digest":"sha256:d716bba6491c52998d154d3eb4228ed6a3e1d0f38a16e518797305f4a20cbc96","observation_id":"50aa65a6-12fc-4ecb-8cbe-07274b962c33","resolution":{"observed_at":"2026-08-07T14:06:59.870258Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.07972","last_updated":"2024-05-30T08:55:12Z","snapshot_observed_at":"2026-08-14T22:26:00.902198Z","submitted_at":"2024-04-11T17:56:05Z","title":"OSWorld: Benchmarking Multimodal Agents for Open-Ended Tasks in Real Computer Environments","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.07972","snapshot_observed_at":"2026-08-07T14:06:57.471803Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20023","last_updated":"2025-05-26T14:11:12Z","snapshot_observed_at":"2026-08-16T13:28:40.997677Z","submitted_at":"2025-05-26T14:11:12Z","title":"Training LLM-Based Agents with Synthetic Self-Reflected Trajectories and Partial Masking","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-07T14:06:57.471803Z"},"links":{"cited_paper":"/paper/2404.07972","citing_paper":"/paper/2505.20023"},"observation_digest":"sha256:a5773fdd9efd9af287569bbed351d98e7774c29b5fe6886a8c58ea54a6bbd94a","observation_id":"e4804db6-1420-4297-ba88-d5c0bbe94f67","resolution":{"observed_at":"2026-08-07T14:06:57.471803Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.10671","last_updated":"2024-09-10T13:25:53Z","snapshot_observed_at":"2026-08-17T11:08:48.802438Z","submitted_at":"2024-07-15T12:35:42Z","title":"Qwen2 Technical Report","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.10671","snapshot_observed_at":"2026-08-07T14:06:57.530924Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20023","last_updated":"2025-05-26T14:11:12Z","snapshot_observed_at":"2026-08-16T13:28:40.997677Z","submitted_at":"2025-05-26T14:11:12Z","title":"Training LLM-Based Agents with Synthetic Self-Reflected Trajectories and Partial Masking","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-07T14:06:57.530924Z"},"links":{"cited_paper":"/paper/2407.10671","citing_paper":"/paper/2505.20023"},"observation_digest":"sha256:61e330e91021aaae47d4d699cb9b666b15bee842b115d52b02836bf1dd8f9e0d","observation_id":"e16cab6c-a3bc-44bb-93cf-586a0c28715c","resolution":{"observed_at":"2026-08-07T14:06:57.530924Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.15793","last_updated":"2024-11-11T20:01:15Z","snapshot_observed_at":"2026-07-06T18:19:29.996982Z","submitted_at":"2024-05-06T17:41:33Z","title":"SWE-agent: Agent-Computer Interfaces Enable Automated Software Engineering","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.15793","snapshot_observed_at":"2026-08-07T14:06:57.590394Z","title":"Jimenez, Alexander Wettig, Kilian Lieret, Shunyu Yao, Karthik Narasimhan, and Ofir Press","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20023","last_updated":"2025-05-26T14:11:12Z","snapshot_observed_at":"2026-08-16T13:28:40.997677Z","submitted_at":"2025-05-26T14:11:12Z","title":"Training LLM-Based Agents with Synthetic Self-Reflected Trajectories and Partial Masking","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-07T14:06:57.590394Z"},"links":{"cited_paper":"/paper/2405.15793","citing_paper":"/paper/2505.20023"},"observation_digest":"sha256:2033fc35db0fbdb9b0013a3d01006dbbe678284dc9b53b9c8d579f30b4866449","observation_id":"966c5ecc-d933-41b1-999b-3e067d337112","resolution":{"observed_at":"2026-08-07T14:06:57.590394Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.13669","last_updated":"2024-05-28T06:39:17Z","snapshot_observed_at":"2026-08-21T16:42:18.745811Z","submitted_at":"2024-02-21T10:06:08Z","title":"Self-Distillation Bridges Distribution Gap in Language Model Fine-Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.13669","snapshot_observed_at":"2026-08-07T14:06:57.661196Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20023","last_updated":"2025-05-26T14:11:12Z","snapshot_observed_at":"2026-08-16T13:28:40.997677Z","submitted_at":"2025-05-26T14:11:12Z","title":"Training LLM-Based Agents with Synthetic Self-Reflected Trajectories and Partial Masking","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-07T14:06:57.661196Z"},"links":{"cited_paper":"/paper/2402.13669","citing_paper":"/paper/2505.20023"},"observation_digest":"sha256:47f5dfef97f895b378fbd8573ae31bdb0abe73705b0a0ade2ae82b2c8bf7e1d0","observation_id":"ba55c0e8-4961-4680-88ee-a3e22e31fa6a","resolution":{"observed_at":"2026-08-07T14:06:57.661196Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:06:59.514522Z","title":null,"venue":null,"work_id":"36f0628b-5967-42bc-bca4-e0f3e044428b","year":2022},"citing_paper":{"arxiv_id":"2505.20023","last_updated":"2025-05-26T14:11:12Z","snapshot_observed_at":"2026-08-16T13:28:40.997677Z","submitted_at":"2025-05-26T14:11:12Z","title":"Training LLM-Based Agents with Synthetic Self-Reflected Trajectories and Partial Masking","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-07T14:06:57.720904Z"},"links":{"citing_paper":"/paper/2505.20023"},"observation_digest":"sha256:815d3f093ed1d45184e3d7c15991b89633da6295f4505a7530494fa244ce4ce2","observation_id":"d62cf0bb-1259-4ed8-af62-35d741551974","resolution":{"observed_at":"2026-08-07T14:06:59.604142Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:06:57.779121Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.20023","last_updated":"2025-05-26T14:11:12Z","snapshot_observed_at":"2026-08-16T13:28:40.997677Z","submitted_at":"2025-05-26T14:11:12Z","title":"Training LLM-Based Agents with Synthetic Self-Reflected Trajectories and Partial Masking","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-07T14:06:57.779121Z"},"links":{"citing_paper":"/paper/2505.20023"},"observation_digest":"sha256:27d8bbb354c23b2f7c8fb14f6d87b658f2a294f144a8478da7d5901450269267","observation_id":"63b0c490-9dc0-4b77-a5c9-20889cc92b9b","resolution":{"observed_at":"2026-08-07T14:06:57.779121Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:06:59.143770Z","title":null,"venue":null,"work_id":"7869eac4-de25-4f26-a4f8-76568757a0a3","year":2024},"citing_paper":{"arxiv_id":"2505.20023","last_updated":"2025-05-26T14:11:12Z","snapshot_observed_at":"2026-08-16T13:28:40.997677Z","submitted_at":"2025-05-26T14:11:12Z","title":"Training LLM-Based Agents with Synthetic Self-Reflected Trajectories and Partial Masking","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-07T14:06:57.820652Z"},"links":{"citing_paper":"/paper/2505.20023"},"observation_digest":"sha256:15ed4e72305a70eefe13982cc0f13e3f9dae65dce2a8f627b78fde6a5b343743","observation_id":"e44a72af-f104-4f0f-a89c-dfc6a7bbe1c1","resolution":{"observed_at":"2026-08-07T14:06:59.239857Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.12823","last_updated":"2023-10-22T16:19:16Z","snapshot_observed_at":"2026-08-18T11:07:04.869605Z","submitted_at":"2023-10-19T15:19:53Z","title":"AgentTuning: Enabling Generalized Agent Abilities for LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.12823","snapshot_observed_at":"2026-08-07T14:06:57.880383Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.20023","last_updated":"2025-05-26T14:11:12Z","snapshot_observed_at":"2026-08-16T13:28:40.997677Z","submitted_at":"2025-05-26T14:11:12Z","title":"Training LLM-Based Agents with Synthetic Self-Reflected Trajectories and Partial Masking","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-07T14:06:57.880383Z"},"links":{"cited_paper":"/paper/2310.12823","citing_paper":"/paper/2505.20023"},"observation_digest":"sha256:4bbb9d84cad1c2ac4f5bf13dc33477df2cc36c8d377fa0744250750085437e72","observation_id":"67a2f167-7450-4a5a-939f-e8152a9ae841","resolution":{"observed_at":"2026-08-07T14:06:57.880383Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.13372","last_updated":"2024-06-27T22:44:48Z","snapshot_observed_at":"2026-08-17T02:51:06.474773Z","submitted_at":"2024-03-20T08:08:54Z","title":"LlamaFactory: Unified Efficient Fine-Tuning of 100+ Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.13372","snapshot_observed_at":"2026-08-07T14:06:57.940517Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20023","last_updated":"2025-05-26T14:11:12Z","snapshot_observed_at":"2026-08-16T13:28:40.997677Z","submitted_at":"2025-05-26T14:11:12Z","title":"Training LLM-Based Agents with Synthetic Self-Reflected Trajectories and Partial Masking","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-07T14:06:57.940517Z"},"links":{"cited_paper":"/paper/2403.13372","citing_paper":"/paper/2505.20023"},"observation_digest":"sha256:fdd56c40c3c37ff042b4a333ea77d687ca236f9024c1f282ec719e9c9d4541de","observation_id":"1193f9fa-6d20-415a-bacb-91bb704bc34e","resolution":{"observed_at":"2026-08-07T14:06:57.940517Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07911","last_updated":"2023-11-14T05:13:55Z","snapshot_observed_at":"2026-07-06T16:47:08.877195Z","submitted_at":"2023-11-14T05:13:55Z","title":"Instruction-Following Evaluation for Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.07911","snapshot_observed_at":"2026-08-07T14:06:58.021707Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.20023","last_updated":"2025-05-26T14:11:12Z","snapshot_observed_at":"2026-08-16T13:28:40.997677Z","submitted_at":"2025-05-26T14:11:12Z","title":"Training LLM-Based Agents with Synthetic Self-Reflected Trajectories and Partial Masking","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-07T14:06:58.021707Z"},"links":{"cited_paper":"/paper/2311.07911","citing_paper":"/paper/2505.20023"},"observation_digest":"sha256:6108cff3efa46e73ec187d019d749a7f6bcca11fbbe4d833713c460b9f23563a","observation_id":"786968d7-ee0e-41a0-b961-3baffbd09026","resolution":{"observed_at":"2026-08-07T14:06:58.021707Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:06:58.041400Z","title":"online\" 'onlinestring :=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.20023","last_updated":"2025-05-26T14:11:12Z","snapshot_observed_at":"2026-08-16T13:28:40.997677Z","submitted_at":"2025-05-26T14:11:12Z","title":"Training LLM-Based Agents with Synthetic Self-Reflected Trajectories and Partial Masking","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-07T14:06:58.041400Z"},"links":{"citing_paper":"/paper/2505.20023"},"observation_digest":"sha256:1e33529f45abb46fcd3a3bef5a478abcc6f53674f59921f65625211047fdb0d7","observation_id":"cccce28e-0198-4534-adfd-be9b68124ba1","resolution":{"observed_at":"2026-08-07T14:06:58.041400Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:06:58.046928Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.20023","last_updated":"2025-05-26T14:11:12Z","snapshot_observed_at":"2026-08-16T13:28:40.997677Z","submitted_at":"2025-05-26T14:11:12Z","title":"Training LLM-Based Agents with Synthetic Self-Reflected Trajectories and Partial Masking","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-07T14:06:58.046928Z"},"links":{"citing_paper":"/paper/2505.20023"},"observation_digest":"sha256:4c9bcbdc404885aeb47d8a1e95ab20be0a9ecf657f6c14cb4395fe9280e1e4c2","observation_id":"837078af-2b8c-4047-852c-ae4a1caf4a3f","resolution":{"observed_at":"2026-08-07T14:06:58.046928Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2505.20023","last_updated":"2025-05-26T14:11:12Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-16T13:28:40.997677Z","submitted_at":"2025-05-26T14:11:12Z","title":"Training LLM-Based Agents with Synthetic Self-Reflected Trajectories and Partial Masking"},"reference_resolution":{"displayed":46,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":43,"verified_exact":3,"verified_fuzzy":0},"total_outbound_references":46},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"thesis":"As of 21 August 2026, this Paper Citation Record lists 46 of 46 outbound references and 2 inbound Pith citation observations for arXiv:2505.20023."}