{"as_of":"2026-08-18T04:10:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:8a7c0c4309efbea9c3700f68a4892eef07fc3cecc83cdbf5bf0f66828d5c8490","coverage":[{"denominator":25,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":25,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-16T12:18:49.217321Z","state":"measured"},{"denominator":27,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":27,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-17T06:30:58.91139+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-14T04:35:18.372917Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-07T14:37:49.973211Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2504.13145","last_updated":"2025-04-18T19:36:21Z","snapshot_observed_at":"2026-08-17T14:34:48.452254Z","submitted_at":"2025-04-17T17:53:54Z","title":"Exploring Expert Failures Improves LLM Agent Tuning","version":2},"cited_work":{"arxiv_id":"2504.13145","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.13145","snapshot_observed_at":"2026-08-07T14:37:49.973211Z","title":"Exploring Expert Failures Improves LLM Agent Tuning","venue":"cs.AI","work_id":"6fe2cedd-07b9-4e33-8452-69b2b355170c","year":2025},"citing_paper":{"arxiv_id":"2505.18121","last_updated":"2025-05-23T17:23:11Z","snapshot_observed_at":"2026-08-15T06:03:30.832367Z","submitted_at":"2025-05-23T17:23:11Z","title":"ProgRM: Build Better GUI Agents with Progress Rewards","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T14:37:45.644348Z"},"links":{"cited_paper":"/paper/2504.13145","citing_paper":"/paper/2505.18121"},"observation_digest":"sha256:4c4fc9dc2e67a0528056773154525932628c86b5d4e2d44d16afba2d546be3bc","observation_id":"58e481f7-a907-4cbb-9051-e260b61b71d4","resolution":{"observed_at":"2026-08-07T14:37:50.068075Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.13145","last_updated":"2025-04-18T19:36:21Z","snapshot_observed_at":"2026-08-17T14:34:48.452254Z","submitted_at":"2025-04-17T17:53:54Z","title":"Exploring Expert Failures Improves LLM Agent Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.13145","snapshot_observed_at":"2026-08-14T04:35:18.372917Z","title":"arXiv preprint arXiv:2504.13145","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.08570","last_updated":"2026-08-09T08:22:57Z","snapshot_observed_at":"2026-08-18T02:23:09.166006Z","submitted_at":"2026-08-09T08:22:57Z","title":"FailForge: Distilling Procedural Competence from Persistent Failures into Code Agents","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-14T04:35:18.372917Z"},"links":{"cited_paper":"/paper/2504.13145","citing_paper":"/paper/2608.08570"},"observation_digest":"sha256:2510cfcdf89e97aea847bd6f3843a9e35c1e16a7d778ba32759ae0eec46bfc5c","observation_id":"ac2fa8c3-3207-4f37-aa2d-4f7a74718ad6","resolution":{"observed_at":"2026-08-14T04:35:18.372917Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2504.13145/citation-record","integrity":"/paper/2504.13145/integrity","json":"/paper/2504.13145/citation-record.json","paper":"/paper/2504.13145"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-17T09:58:46.058102Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-16T12:18:48.351840Z","title":"Gpt-4 technical report","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.13145","last_updated":"2025-04-18T19:36:21Z","snapshot_observed_at":"2026-08-17T14:34:48.452254Z","submitted_at":"2025-04-17T17:53:54Z","title":"Exploring Expert Failures Improves LLM Agent Tuning","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-16T12:18:48.351840Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2504.13145"},"observation_digest":"sha256:cad7f40b27249a8b54f1421d39e6a214ed254eeb73486a2199abd118df7e942f","observation_id":"249b3db7-8aff-4e77-b34a-f77a8c814a26","resolution":{"observed_at":"2026-08-16T12:18:48.351840Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.12881","last_updated":"2024-03-19T16:26:10Z","snapshot_observed_at":"2026-08-16T14:08:19.460947Z","submitted_at":"2024-03-19T16:26:10Z","title":"Agent-FLAN: Designing Data and Methods of Effective Agent Tuning for Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.12881","snapshot_observed_at":"2026-08-16T12:18:48.456453Z","title":"Agent-flan: Designing data and methods of effective agent tuning for large language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.13145","last_updated":"2025-04-18T19:36:21Z","snapshot_observed_at":"2026-08-17T14:34:48.452254Z","submitted_at":"2025-04-17T17:53:54Z","title":"Exploring Expert Failures Improves LLM Agent Tuning","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-16T12:18:48.456453Z"},"links":{"cited_paper":"/paper/2403.12881","citing_paper":"/paper/2504.13145"},"observation_digest":"sha256:94108be194584926e8c6ab59ec9904fed9034c935710ffda98c18f076cbf8b85","observation_id":"d0d3ecae-0ccb-4ac0-9a07-f0eaa1188143","resolution":{"observed_at":"2026-08-16T12:18:48.456453Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.02197","last_updated":"2025-06-05T01:42:08Z","snapshot_observed_at":"2026-08-16T12:53:22.712391Z","submitted_at":"2025-03-04T02:14:55Z","title":"ATLaS: Agent Tuning via Learning Critical Steps","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.02197","snapshot_observed_at":"2026-08-16T12:18:48.461379Z","title":"Atlas: Agent tuning via learning critical steps","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.13145","last_updated":"2025-04-18T19:36:21Z","snapshot_observed_at":"2026-08-17T14:34:48.452254Z","submitted_at":"2025-04-17T17:53:54Z","title":"Exploring Expert Failures Improves LLM Agent Tuning","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-16T12:18:48.461379Z"},"links":{"cited_paper":"/paper/2503.02197","citing_paper":"/paper/2504.13145"},"observation_digest":"sha256:a8c382adf9f9b392df8f1f0326a0bed9e07f2dd54c4ec5ba4c7e4739edb8b0fc","observation_id":"84cfe1d2-0b4d-4f22-8fa9-e6bc399ca847","resolution":{"observed_at":"2026-08-16T12:18:48.461379Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1502.02259","last_updated":"2015-02-08T14:58:50Z","snapshot_observed_at":"2026-08-14T23:00:56.212471Z","submitted_at":"2015-02-08T14:58:50Z","title":"Contextual Markov Decision Processes","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1502.02259","snapshot_observed_at":"2026-08-16T12:18:48.505040Z","title":"Contextual markov decision pro- cesses","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.13145","last_updated":"2025-04-18T19:36:21Z","snapshot_observed_at":"2026-08-17T14:34:48.452254Z","submitted_at":"2025-04-17T17:53:54Z","title":"Exploring Expert Failures Improves LLM Agent Tuning","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-16T12:18:48.505040Z"},"links":{"cited_paper":"/paper/1502.02259","citing_paper":"/paper/2504.13145"},"observation_digest":"sha256:88b369383fadf8f876d4ab1a1aff4224da229d5960b9cdc271f0b12ee7c54201","observation_id":"72cc724b-ec18-4e01-8074-87fae4431a62","resolution":{"observed_at":"2026-08-16T12:18:48.505040Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2207.05608","last_updated":"2022-07-12T15:20:48Z","snapshot_observed_at":"2026-08-17T09:42:08.942018Z","submitted_at":"2022-07-12T15:20:48Z","title":"Inner Monologue: Embodied Reasoning through Planning with Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2207.05608","snapshot_observed_at":"2026-08-16T12:18:48.636400Z","title":"Language models as zero-shot planners: Extracting actionable knowledge for embodied agents","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.13145","last_updated":"2025-04-18T19:36:21Z","snapshot_observed_at":"2026-08-17T14:34:48.452254Z","submitted_at":"2025-04-17T17:53:54Z","title":"Exploring Expert Failures Improves LLM Agent Tuning","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-16T12:18:48.636400Z"},"links":{"cited_paper":"/paper/2207.05608","citing_paper":"/paper/2504.13145"},"observation_digest":"sha256:ef1039f732d53882f7dcb893f91aa913f014bf63e5ed1eb6d67c2a85c38151cd","observation_id":"cc2a8a1b-8fc2-475e-bf22-77fb5cbf60a5","resolution":{"observed_at":"2026-08-16T12:18:48.636400Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.13424","last_updated":"2023-04-26T10:12:12Z","snapshot_observed_at":"2026-08-16T21:31:10.696210Z","submitted_at":"2023-04-26T10:12:12Z","title":"Can Agents Run Relay Race with Strangers? Generalization of RL to Out-of-Distribution Trajectories","version":1},"cited_work":{"arxiv_id":"2304.13424","doi":null,"metadata_source":"pith","pith_arxiv_id":"2304.13424","snapshot_observed_at":"2026-08-16T12:18:49.459137Z","title":"Can Agents Run Relay Race with Strangers? Generalization of RL to Out-of-Distribution Trajectories","venue":"cs.LG","work_id":"bf9ed5b1-7a23-473e-812c-da8441dcc41b","year":2023},"citing_paper":{"arxiv_id":"2504.13145","last_updated":"2025-04-18T19:36:21Z","snapshot_observed_at":"2026-08-17T14:34:48.452254Z","submitted_at":"2025-04-17T17:53:54Z","title":"Exploring Expert Failures Improves LLM Agent Tuning","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-16T12:18:48.642240Z"},"links":{"cited_paper":"/paper/2304.13424","citing_paper":"/paper/2504.13145"},"observation_digest":"sha256:382fda0d195927fbe6ce7b587085f4e64538664606592aa145047853970e3f5d","observation_id":"44a0e70f-1438-40bc-8e6c-d88f0b49fba0","resolution":{"observed_at":"2026-08-16T12:18:49.545440Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.15538","last_updated":"2024-02-23T06:25:20Z","snapshot_observed_at":"2026-08-17T05:45:32.513069Z","submitted_at":"2024-02-23T06:25:20Z","title":"AgentLite: A Lightweight Library for Building and Advancing Task-Oriented LLM Agent System","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.15538","snapshot_observed_at":"2026-08-16T12:18:48.647661Z","title":"Zhiwei Liu, Weiran Yao, Jianguo Zhang, Liangwei Yang, Zuxin Liu, Juntao Tan, Prafulla K Choubey, Tian Lan, Jason Wu, Huan Wang, et al","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.13145","last_updated":"2025-04-18T19:36:21Z","snapshot_observed_at":"2026-08-17T14:34:48.452254Z","submitted_at":"2025-04-17T17:53:54Z","title":"Exploring Expert Failures Improves LLM Agent Tuning","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-16T12:18:48.647661Z"},"links":{"cited_paper":"/paper/2402.15538","citing_paper":"/paper/2504.13145"},"observation_digest":"sha256:7e5d1f987f690bf923f509c05f1bea517b8dd3f696d1e7a289558bea1a78c1ea","observation_id":"8a194436-aeff-4e10-bc78-a7631828a1d7","resolution":{"observed_at":"2026-08-16T12:18:48.647661Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.13178","last_updated":"2024-12-23T20:12:48Z","snapshot_observed_at":"2026-08-16T14:25:01.697568Z","submitted_at":"2024-01-24T01:51:00Z","title":"AgentBoard: An Analytical Evaluation Board of Multi-turn LLM Agents","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.13178","snapshot_observed_at":"2026-08-16T12:18:48.652037Z","title":"Agentboard: An analytical evaluation board of multi-turn llm agents","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.13145","last_updated":"2025-04-18T19:36:21Z","snapshot_observed_at":"2026-08-17T14:34:48.452254Z","submitted_at":"2025-04-17T17:53:54Z","title":"Exploring Expert Failures Improves LLM Agent Tuning","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-16T12:18:48.652037Z"},"links":{"cited_paper":"/paper/2401.13178","citing_paper":"/paper/2504.13145"},"observation_digest":"sha256:09a0151934d0d7148e576f5c899c6f0e0005af9d9cf72b1bf75c8b73224386a7","observation_id":"b03e05ab-cc8b-4679-b438-1eb760f011d3","resolution":{"observed_at":"2026-08-16T12:18:48.652037Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.10080","last_updated":"2023-10-16T05:21:50Z","snapshot_observed_at":"2026-08-16T14:51:54.405312Z","submitted_at":"2023-10-16T05:21:50Z","title":"Let's reward step by step: Step-Level reward model as the Navigators for Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.10080","snapshot_observed_at":"2026-08-16T12:18:48.731690Z","title":"org/CorpusID:267199917","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.13145","last_updated":"2025-04-18T19:36:21Z","snapshot_observed_at":"2026-08-17T14:34:48.452254Z","submitted_at":"2025-04-17T17:53:54Z","title":"Exploring Expert Failures Improves LLM Agent Tuning","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-16T12:18:48.731690Z"},"links":{"cited_paper":"/paper/2310.10080","citing_paper":"/paper/2504.13145"},"observation_digest":"sha256:54c568c40033788c23ada11fcae041d17c364bc8248696afc7bbae83344750e0","observation_id":"8c65e9a6-bc17-4964-b91e-9929624fb5c5","resolution":{"observed_at":"2026-08-16T12:18:48.731690Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.18290","last_updated":"2024-07-29T22:26:36Z","snapshot_observed_at":"2026-08-01T16:34:38.795326Z","submitted_at":"2023-05-29T17:57:46Z","title":"Direct Preference Optimization: Your Language Model is Secretly a Reward Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.18290","snapshot_observed_at":"2026-08-16T12:18:48.806241Z","title":"Manning, and Chelsea Finn","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.13145","last_updated":"2025-04-18T19:36:21Z","snapshot_observed_at":"2026-08-17T14:34:48.452254Z","submitted_at":"2025-04-17T17:53:54Z","title":"Exploring Expert Failures Improves LLM Agent Tuning","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-16T12:18:48.806241Z"},"links":{"cited_paper":"/paper/2305.18290","citing_paper":"/paper/2504.13145"},"observation_digest":"sha256:11f4e847026fdf5b8c3b6f05a6b63a4f7ffd0125fb525af36f6e4510e57bb490","observation_id":"0734153d-3925-46e4-9365-2bd38a29105a","resolution":{"observed_at":"2026-08-16T12:18:48.806241Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:18:49.692733Z","title":"Co-Reyes, Rishabh Agarwal, Ankesh Anand, Piyush Patil, Peter J","venue":null,"work_id":"e86cf00d-8a34-49b8-ab23-0469676d8a76","year":2024},"citing_paper":{"arxiv_id":"2504.13145","last_updated":"2025-04-18T19:36:21Z","snapshot_observed_at":"2026-08-17T14:34:48.452254Z","submitted_at":"2025-04-17T17:53:54Z","title":"Exploring Expert Failures Improves LLM Agent Tuning","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-16T12:18:48.811365Z"},"links":{"citing_paper":"/paper/2504.13145"},"observation_digest":"sha256:1c42b3a8c138417c2bc9fd990cd3ab354936b132f2b79c5e590a3a3a9747441e","observation_id":"44660778-45d2-4f54-9d0c-b38c82ffa363","resolution":{"observed_at":"2026-08-16T12:18:49.744493Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.07706","last_updated":"2024-10-10T08:19:12Z","snapshot_observed_at":"2026-08-16T13:10:48.423761Z","submitted_at":"2024-10-10T08:19:12Z","title":"AgentBank: Towards Generalized LLM Agents via Fine-Tuning on 50000+ Interaction Trajectories","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.07706","snapshot_observed_at":"2026-08-16T12:18:48.816530Z","title":"Yifan Song, Weimin Xiong, Xiutian Zhao, Dawei Zhu, Wenhao Wu, Ke Wang, Cheng Li, Wei Peng, and Sujian Li","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.13145","last_updated":"2025-04-18T19:36:21Z","snapshot_observed_at":"2026-08-17T14:34:48.452254Z","submitted_at":"2025-04-17T17:53:54Z","title":"Exploring Expert Failures Improves LLM Agent Tuning","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-16T12:18:48.816530Z"},"links":{"cited_paper":"/paper/2410.07706","citing_paper":"/paper/2504.13145"},"observation_digest":"sha256:fcfd135aedfe8c3c0e42ff329d90b23b6a48e3c00b13475d917df8d1dc7f9698","observation_id":"76c7a648-bc90-4e61-a3c0-e7323f7616ec","resolution":{"observed_at":"2026-08-16T12:18:48.816530Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-16T12:18:48.822368Z","title":"Hugo Touvron, Louis Martin, Kevin R","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.13145","last_updated":"2025-04-18T19:36:21Z","snapshot_observed_at":"2026-08-17T14:34:48.452254Z","submitted_at":"2025-04-17T17:53:54Z","title":"Exploring Expert Failures Improves LLM Agent Tuning","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-16T12:18:48.822368Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2504.13145"},"observation_digest":"sha256:423b506e3bb5736ed425ffd9301a01031c3f4965d0c28583be1276d7c78227dc","observation_id":"d39c7cb4-c684-413d-937d-243cf74acd92","resolution":{"observed_at":"2026-08-16T12:18:48.822368Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.16291","last_updated":"2023-10-19T16:27:03Z","snapshot_observed_at":"2026-08-13T16:55:46.498156Z","submitted_at":"2023-05-25T17:46:38Z","title":"Voyager: An Open-Ended Embodied Agent with Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.16291","snapshot_observed_at":"2026-08-16T12:18:48.932683Z","title":"Guanzhi Wang, Yuqi Xie, Yunfan Jiang, Ajay Mandlekar, Chaowei Xiao, Yuke Zhu, Linxi Fan, and Anima Anandkumar","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.13145","last_updated":"2025-04-18T19:36:21Z","snapshot_observed_at":"2026-08-17T14:34:48.452254Z","submitted_at":"2025-04-17T17:53:54Z","title":"Exploring Expert Failures Improves LLM Agent Tuning","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-16T12:18:48.932683Z"},"links":{"cited_paper":"/paper/2305.16291","citing_paper":"/paper/2504.13145"},"observation_digest":"sha256:35d884bb4696de9ffa1500d3704f218b82b8580c3eb1a4d481d58c4822c1b3ae","observation_id":"28eeec0e-a312-48d7-88fc-48956ab785d8","resolution":{"observed_at":"2026-08-16T12:18:48.932683Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11176","last_updated":"2024-09-24T10:01:31Z","snapshot_observed_at":"2026-08-16T13:42:26.491534Z","submitted_at":"2024-06-17T03:29:13Z","title":"Watch Every Step! LLM Agent Learning via Iterative Step-Level Process Refinement","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.11176","snapshot_observed_at":"2026-08-16T12:18:49.043336Z","title":"Watch every step! llm agent learning via iterative step-level process refinement","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.13145","last_updated":"2025-04-18T19:36:21Z","snapshot_observed_at":"2026-08-17T14:34:48.452254Z","submitted_at":"2025-04-17T17:53:54Z","title":"Exploring Expert Failures Improves LLM Agent Tuning","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-16T12:18:49.043336Z"},"links":{"cited_paper":"/paper/2406.11176","citing_paper":"/paper/2504.13145"},"observation_digest":"sha256:a70d0f858513b9fa4d494e33c2a7bfe907117f2782a059788d9c31332024a528","observation_id":"592ad90b-a4d2-4c0a-a807-e590420720b9","resolution":{"observed_at":"2026-08-16T12:18:49.043336Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.01825","last_updated":"2023-09-13T03:57:29Z","snapshot_observed_at":"2026-08-16T18:17:11.146813Z","submitted_at":"2023-08-03T15:34:01Z","title":"Scaling Relationship on Learning Mathematical Reasoning with Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.01825","snapshot_observed_at":"2026-08-16T12:18:49.048092Z","title":"Scaling relationship on learning mathematical reasoning with large language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.13145","last_updated":"2025-04-18T19:36:21Z","snapshot_observed_at":"2026-08-17T14:34:48.452254Z","submitted_at":"2025-04-17T17:53:54Z","title":"Exploring Expert Failures Improves LLM Agent Tuning","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-16T12:18:49.048092Z"},"links":{"cited_paper":"/paper/2308.01825","citing_paper":"/paper/2504.13145"},"observation_digest":"sha256:381be830ca23fdb968c9351e3fe029ff9e93b633caaad91f5f82ec4724172bec","observation_id":"c99db4df-5e29-4fb1-8941-6487d8232cc0","resolution":{"observed_at":"2026-08-16T12:18:49.048092Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.12823","last_updated":"2023-10-22T16:19:16Z","snapshot_observed_at":"2026-08-18T03:58:04.885396Z","submitted_at":"2023-10-19T15:19:53Z","title":"AgentTuning: Enabling Generalized Agent Abilities for LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.12823","snapshot_observed_at":"2026-08-16T12:18:49.053848Z","title":"Aohan Zeng, Mingdao Liu, Rui Lu, Bowen Wang, Xiao Liu, Yuxiao Dong, and Jie Tang","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.13145","last_updated":"2025-04-18T19:36:21Z","snapshot_observed_at":"2026-08-17T14:34:48.452254Z","submitted_at":"2025-04-17T17:53:54Z","title":"Exploring Expert Failures Improves LLM Agent Tuning","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-16T12:18:49.053848Z"},"links":{"cited_paper":"/paper/2310.12823","citing_paper":"/paper/2504.13145"},"observation_digest":"sha256:fb3f3f899f570595a7ef69adf3de94c02f659c3e547b98ef5ca16c62efda22a4","observation_id":"0395c9fb-f92f-411d-9e33-5911a80ef306","resolution":{"observed_at":"2026-08-16T12:18:49.053848Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.15506","last_updated":"2024-11-09T00:28:26Z","snapshot_observed_at":"2026-08-16T14:15:48.898355Z","submitted_at":"2024-02-23T18:56:26Z","title":"AgentOhana: Design Unified Data and Training Pipeline for Effective Agent Learning","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.15506","snapshot_observed_at":"2026-08-16T12:18:49.121774Z","title":"Agentohana: Design unified data and training pipeline for effective agent learning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.13145","last_updated":"2025-04-18T19:36:21Z","snapshot_observed_at":"2026-08-17T14:34:48.452254Z","submitted_at":"2025-04-17T17:53:54Z","title":"Exploring Expert Failures Improves LLM Agent Tuning","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-16T12:18:49.121774Z"},"links":{"cited_paper":"/paper/2402.15506","citing_paper":"/paper/2504.13145"},"observation_digest":"sha256:33cb4e58b77ca87412194d4dede4b48fcc07f88b1ea77d554dec4967a693cb9c","observation_id":"038236ee-fc72-4ba4-8dc0-6b827899e086","resolution":{"observed_at":"2026-08-16T12:18:49.121774Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.13854","last_updated":"2024-04-16T15:13:18Z","snapshot_observed_at":"2026-08-14T11:14:55.351653Z","submitted_at":"2023-07-25T22:59:32Z","title":"WebArena: A Realistic Web Environment for Building Autonomous Agents","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.13854","snapshot_observed_at":"2026-08-16T12:18:49.217321Z","title":"Webarena: A realistic web environment for building autonomous agents","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.13145","last_updated":"2025-04-18T19:36:21Z","snapshot_observed_at":"2026-08-17T14:34:48.452254Z","submitted_at":"2025-04-17T17:53:54Z","title":"Exploring Expert Failures Improves LLM Agent Tuning","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-16T12:18:49.217321Z"},"links":{"cited_paper":"/paper/2307.13854","citing_paper":"/paper/2504.13145"},"observation_digest":"sha256:6066ae373737bad60a2014ec39b8849faf95c6810df2e20913c7ea2a6243e0d7","observation_id":"21a63a2a-87fe-4779-8e77-355d2a965055","resolution":{"observed_at":"2026-08-16T12:18:49.217321Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.03817","last_updated":"2024-12-09T09:20:11Z","snapshot_observed_at":"2026-08-16T13:02:28.796394Z","submitted_at":"2024-11-06T10:35:11Z","title":"From Novice to Expert: LLM Agent Policy Optimization via Step-wise Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.03817","snapshot_observed_at":"2026-08-16T12:18:48.467217Z","title":"From novice to expert: Llm agent policy optimization via step-wise reinforcement learning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.13145","last_updated":"2025-04-18T19:36:21Z","snapshot_observed_at":"2026-08-17T14:34:48.452254Z","submitted_at":"2025-04-17T17:53:54Z","title":"Exploring Expert Failures Improves LLM Agent Tuning","version":2},"reference_index":2006,"source":"pdf_text","source_observed_at":"2026-08-16T12:18:48.467217Z"},"links":{"cited_paper":"/paper/2411.03817","citing_paper":"/paper/2504.13145"},"observation_digest":"sha256:0ac93779da51b059ab8a43c9cb2936bf6c3f8b84f4387ae32a4576b8a25d0de7","observation_id":"ebf6be87-6040-4376-b23e-04bfd0ca8bc8","resolution":{"observed_at":"2026-08-16T12:18:48.467217Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.10963","last_updated":"2024-06-25T03:14:10Z","snapshot_observed_at":"2026-08-16T14:18:50.765820Z","submitted_at":"2024-02-13T20:16:29Z","title":"GLoRe: When, Where, and How to Improve LLM Reasoning via Global and Local Refinements","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.10963","snapshot_observed_at":"2026-08-16T12:18:48.585351Z","title":"Alex Havrilla, Sharath Raparthy, Christoforus Nalmpantis, Jane Dwivedi-Yu, Maksym Zhuravinskyi, Eric Hambro, and Roberta Raileanu","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.13145","last_updated":"2025-04-18T19:36:21Z","snapshot_observed_at":"2026-08-17T14:34:48.452254Z","submitted_at":"2025-04-17T17:53:54Z","title":"Exploring Expert Failures Improves LLM Agent Tuning","version":2},"reference_index":2015,"source":"pdf_text","source_observed_at":"2026-08-16T12:18:48.585351Z"},"links":{"cited_paper":"/paper/2402.10963","citing_paper":"/paper/2504.13145"},"observation_digest":"sha256:9c4d665a5ac70e014f3867f5b811ec159bea99ccc56989b842ba22827c5d8d5d","observation_id":"72ea9de0-b53f-46ba-a609-7c688668cfed","resolution":{"observed_at":"2026-08-16T12:18:48.585351Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.02658","last_updated":"2024-10-14T19:33:00Z","snapshot_observed_at":"2026-08-16T14:21:36.891912Z","submitted_at":"2024-02-05T00:57:51Z","title":"Multi-step Problem Solving Through a Verifier: An Empirical Analysis on Model-induced Process Supervision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.02658","snapshot_observed_at":"2026-08-16T12:18:49.037721Z","title":"Zihan Wang, Yunxuan Li, Yuexin Wu, Liangchen Luo, Le Hou, Hongkun Yu, and Jingbo Shang","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.13145","last_updated":"2025-04-18T19:36:21Z","snapshot_observed_at":"2026-08-17T14:34:48.452254Z","submitted_at":"2025-04-17T17:53:54Z","title":"Exploring Expert Failures Improves LLM Agent Tuning","version":2},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-16T12:18:49.037721Z"},"links":{"cited_paper":"/paper/2402.02658","citing_paper":"/paper/2504.13145"},"observation_digest":"sha256:96ee0c3b246fa2e404fb5173e5c9047541cd7979bcc84d50e8b62840923ae329","observation_id":"83a868b4-051e-4786-b2b0-982c031b2ea0","resolution":{"observed_at":"2026-08-16T12:18:49.037721Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.05915","last_updated":"2023-10-09T17:58:38Z","snapshot_observed_at":"2026-08-16T14:53:43.494263Z","submitted_at":"2023-10-09T17:58:38Z","title":"FireAct: Toward Language Agent Fine-tuning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.05915","snapshot_observed_at":"2026-08-16T12:18:48.450541Z","title":"Fireact: Toward language agent fine-tuning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.13145","last_updated":"2025-04-18T19:36:21Z","snapshot_observed_at":"2026-08-17T14:34:48.452254Z","submitted_at":"2025-04-17T17:53:54Z","title":"Exploring Expert Failures Improves LLM Agent Tuning","version":2},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-16T12:18:48.450541Z"},"links":{"cited_paper":"/paper/2310.05915","citing_paper":"/paper/2504.13145"},"observation_digest":"sha256:992b666b8efb60da7ab22417279345082927225e55747f7e440e377123b24fdb","observation_id":"c5dd1a83-41b9-4a2f-97c9-555ac768a72b","resolution":{"observed_at":"2026-08-16T12:18:48.450541Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.10003","last_updated":"2023-12-15T18:20:15Z","snapshot_observed_at":"2026-08-16T14:34:18.917937Z","submitted_at":"2023-12-15T18:20:15Z","title":"ReST meets ReAct: Self-Improvement for Multi-Step Reasoning LLM Agent","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.10003","snapshot_observed_at":"2026-08-16T12:18:48.417057Z","title":"Renat Aksitov, Sobhan Miryoosefi, Zonglin Li, Daliang Li, Sheila Babayan, Kavya Koppa- rapu, Zachary Fisher, Ruiqi Guo, Sushant Prakash, Pranesh Srinivasan, et al","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.13145","last_updated":"2025-04-18T19:36:21Z","snapshot_observed_at":"2026-08-17T14:34:48.452254Z","submitted_at":"2025-04-17T17:53:54Z","title":"Exploring Expert Failures Improves LLM Agent Tuning","version":2},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-16T12:18:48.417057Z"},"links":{"cited_paper":"/paper/2312.10003","citing_paper":"/paper/2504.13145"},"observation_digest":"sha256:0c9a36c7b6a1294f0d670c2dfd868acff559ad5f59fb0e35b438673321937577","observation_id":"98cd6fc3-0cdb-4b1e-9952-546dc8930ff9","resolution":{"observed_at":"2026-08-16T12:18:48.417057Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.08935","last_updated":"2024-02-19T14:07:53Z","snapshot_observed_at":"2026-08-14T10:08:59.886019Z","submitted_at":"2023-12-14T13:41:54Z","title":"Math-Shepherd: Verify and Reinforce LLMs Step-by-step without Human Annotations","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.08935","snapshot_observed_at":"2026-08-16T12:18:49.032082Z","title":"Math-shepherd: A label-free step-by-step verifier for llms in mathematical reasoning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.13145","last_updated":"2025-04-18T19:36:21Z","snapshot_observed_at":"2026-08-17T14:34:48.452254Z","submitted_at":"2025-04-17T17:53:54Z","title":"Exploring Expert Failures Improves LLM Agent Tuning","version":2},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-16T12:18:49.032082Z"},"links":{"cited_paper":"/paper/2312.08935","citing_paper":"/paper/2504.13145"},"observation_digest":"sha256:d03db5057f24077bd2e36a95eb310dd0aa9ab6e8cb523e146e3c0652d1f6e55d","observation_id":"64679209-0df5-4952-8128-8e06271f7c27","resolution":{"observed_at":"2026-08-16T12:18:49.032082Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2504.13145","last_updated":"2025-04-18T19:36:21Z","latest_version":2,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-17T14:34:48.452254Z","submitted_at":"2025-04-17T17:53:54Z","title":"Exploring Expert Failures Improves LLM Agent Tuning"},"reference_resolution":{"displayed":25,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":23,"verified_exact":1,"verified_fuzzy":1},"total_outbound_references":25},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"thesis":"As of 18 August 2026, this Paper Citation Record lists 25 of 25 outbound references and 2 inbound Pith citation observations for arXiv:2504.13145."}