{"as_of":"2026-08-10T03:45:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:1dcc1037177ed9088d79fca750cc856934a8b98598e0da66fcec6bbd58ebe347","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":18,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":18,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":18,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":18,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-09T13:31:47.258759Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-03T21:18:59.738705Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2311.18760","last_updated":"2024-11-01T14:37:37Z","snapshot_observed_at":"2026-07-06T16:55:09.267685Z","submitted_at":"2023-11-30T18:02:44Z","title":"TaskBench: Benchmarking Large Language Models for Task Automation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.18760","snapshot_observed_at":"2026-08-09T13:31:47.258759Z","title":"Taskbench: Benchmarking large language models for task automation,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.02067","last_updated":"2025-03-06T18:09:38Z","snapshot_observed_at":"2026-08-10T01:19:02.845098Z","submitted_at":"2025-02-04T07:32:39Z","title":"AdaptBot: Combining LLM with Knowledge Graphs and Human Input for Generic-to-Specific Task Decomposition and Knowledge Refinement","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-09T13:31:47.258759Z"},"links":{"cited_paper":"/paper/2311.18760","citing_paper":"/paper/2502.02067"},"observation_digest":"sha256:7f990d03ebe210825e6836603000d227be54bb2a15c4db33c82606aaf3d78d16","observation_id":"c3f77fc0-34fe-4860-a236-f3a330bb0d90","resolution":{"observed_at":"2026-08-09T13:31:47.258759Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.18760","last_updated":"2024-11-01T14:37:37Z","snapshot_observed_at":"2026-07-06T16:55:09.267685Z","submitted_at":"2023-11-30T18:02:44Z","title":"TaskBench: Benchmarking Large Language Models for Task Automation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.18760","snapshot_observed_at":"2026-08-07T05:02:29.265475Z","title":"Taskbench: Benchmarking large language models for task automation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.08933","last_updated":"2025-06-10T15:59:38Z","snapshot_observed_at":"2026-08-09T17:02:05.514868Z","submitted_at":"2025-06-10T15:59:38Z","title":"What Limits Virtual Agent Application? OmniBench: A Scalable Multi-Dimensional Benchmark for Essential Virtual Agent Capabilities","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-07T05:02:29.265475Z"},"links":{"cited_paper":"/paper/2311.18760","citing_paper":"/paper/2506.08933"},"observation_digest":"sha256:9882ccaf957341bd40afd407a02bd0f4492eebcb46a2698dad12766f981b9524","observation_id":"06084d52-bd1f-4843-ba0b-22d00827e86e","resolution":{"observed_at":"2026-08-07T05:02:29.265475Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.18760","last_updated":"2024-11-01T14:37:37Z","snapshot_observed_at":"2026-07-06T16:55:09.267685Z","submitted_at":"2023-11-30T18:02:44Z","title":"TaskBench: Benchmarking Large Language Models for Task Automation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.18760","snapshot_observed_at":"2026-08-07T04:44:03.797982Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.13977","last_updated":"2025-06-11T17:59:18Z","snapshot_observed_at":"2026-08-09T16:30:27.870641Z","submitted_at":"2025-06-11T17:59:18Z","title":"CRITICTOOL: Evaluating Self-Critique Capabilities of Large Language Models in Tool-Calling Error Scenarios","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-07T04:44:03.797982Z"},"links":{"cited_paper":"/paper/2311.18760","citing_paper":"/paper/2506.13977"},"observation_digest":"sha256:e5e7ba5c6005491a81689391d7b314539f8337bb28e5ad1b4fddf9420bf1619f","observation_id":"8a54ff64-1f1d-4520-a5f0-b99007a8a92c","resolution":{"observed_at":"2026-08-07T04:44:03.797982Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.18760","last_updated":"2024-11-01T14:37:37Z","snapshot_observed_at":"2026-07-06T16:55:09.267685Z","submitted_at":"2023-11-30T18:02:44Z","title":"TaskBench: Benchmarking Large Language Models for Task Automation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.18760","snapshot_observed_at":"2026-08-06T22:02:40.257193Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.22853","last_updated":"2025-07-02T07:55:09Z","snapshot_observed_at":"2026-08-09T18:57:10.167031Z","submitted_at":"2025-06-28T11:28:04Z","title":"DICE-BENCH: Evaluating the Tool-Use Capabilities of Large Language Models in Multi-Round, Multi-Party Dialogues","version":2},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-06T22:02:40.257193Z"},"links":{"cited_paper":"/paper/2311.18760","citing_paper":"/paper/2506.22853"},"observation_digest":"sha256:0e3ab594035ce99b33e82f911363684b8ab9415be7e70d5c751c6f2be8a45a51","observation_id":"ab839f1b-689b-47f7-a359-3fff8177c7b7","resolution":{"observed_at":"2026-08-06T22:02:40.257193Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.18760","last_updated":"2024-11-01T14:37:37Z","snapshot_observed_at":"2026-07-06T16:55:09.267685Z","submitted_at":"2023-11-30T18:02:44Z","title":"TaskBench: Benchmarking Large Language Models for Task Automation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.18760","snapshot_observed_at":"2026-08-06T15:39:58.036946Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.15296","last_updated":"2025-07-21T06:55:37Z","snapshot_observed_at":"2026-08-09T08:28:26.487927Z","submitted_at":"2025-07-21T06:55:37Z","title":"Butterfly Effects in Toolchains: A Comprehensive Analysis of Failed Parameter Filling in LLM Tool-Agent Systems","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-06T15:39:58.036946Z"},"links":{"cited_paper":"/paper/2311.18760","citing_paper":"/paper/2507.15296"},"observation_digest":"sha256:6528f269a4bf75dc4a62e11af8460bc01528cae070d115b9e62e11a951644070","observation_id":"0ff91483-f9bd-427e-b52e-bc1f71953158","resolution":{"observed_at":"2026-08-06T15:39:58.036946Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.18760","last_updated":"2024-11-01T14:37:37Z","snapshot_observed_at":"2026-07-06T16:55:09.267685Z","submitted_at":"2023-11-30T18:02:44Z","title":"TaskBench: Benchmarking Large Language Models for Task Automation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.18760","snapshot_observed_at":"2026-08-06T12:44:21.762114Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.21504","last_updated":"2025-07-29T04:57:02Z","snapshot_observed_at":"2026-08-06T15:35:42.279155Z","submitted_at":"2025-07-29T04:57:02Z","title":"Evaluation and Benchmarking of LLM Agents: A Survey","version":1},"reference_index":96,"source":"pdf_text","source_observed_at":"2026-08-06T12:44:21.762114Z"},"links":{"cited_paper":"/paper/2311.18760","citing_paper":"/paper/2507.21504"},"observation_digest":"sha256:1c13f56f40d8ba498eccfa2b430e6eff54d2e75650e117b393f4c7134cd3e89e","observation_id":"8fd32775-a877-4f2f-8338-4d5d8e800dc2","resolution":{"observed_at":"2026-08-06T12:44:21.762114Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.18760","last_updated":"2024-11-01T14:37:37Z","snapshot_observed_at":"2026-07-06T16:55:09.267685Z","submitted_at":"2023-11-30T18:02:44Z","title":"TaskBench: Benchmarking Large Language Models for Task Automation","version":4},"cited_work":{"arxiv_id":"2311.18760","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2311.18760","snapshot_observed_at":"2026-07-03T21:18:59.738705Z","title":"name\" - concise snake_case identifier -","venue":null,"work_id":"b61538cd-9b66-42fd-831b-0f003ecaeb93","year":2023},"citing_paper":{"arxiv_id":"2602.21265","last_updated":"2026-05-18T08:26:18Z","snapshot_observed_at":"2026-08-02T06:00:00.618001Z","submitted_at":"2026-02-24T09:23:12Z","title":"ToolMATH: A Diagnostic Benchmark for Long-Horizon Tool Use under Systematic Tool-Catalog Constraints","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-21T11:57:53.779767Z"},"links":{"cited_paper":"/paper/2311.18760","citing_paper":"/paper/2602.21265"},"observation_digest":"sha256:e192dd22a64dc104edb0171ef0dcbce097db6478d87897c7236ffb0e910ccc7c","observation_id":"5fd0df3b-8120-4a59-9dc2-31261a1047b8","resolution":{"observed_at":"2026-05-21T12:00:04.241730Z","resolver_source":"arxiv_id","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.18760","last_updated":"2024-11-01T14:37:37Z","snapshot_observed_at":"2026-07-06T16:55:09.267685Z","submitted_at":"2023-11-30T18:02:44Z","title":"TaskBench: Benchmarking Large Language Models for Task Automation","version":4},"cited_work":{"arxiv_id":"2311.18760","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2311.18760","snapshot_observed_at":"2026-07-03T21:18:59.738705Z","title":"name\" - concise snake_case identifier -","venue":null,"work_id":"b61538cd-9b66-42fd-831b-0f003ecaeb93","year":2023},"citing_paper":{"arxiv_id":"2605.03986","last_updated":"2026-05-05T17:08:26Z","snapshot_observed_at":"2026-07-06T23:16:49.553583Z","submitted_at":"2026-05-05T17:08:26Z","title":"From Intent to Execution: Composing Agentic Workflows with Agent Recommendation","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-07T16:19:39.392516Z"},"links":{"cited_paper":"/paper/2311.18760","citing_paper":"/paper/2605.03986"},"observation_digest":"sha256:0e87fc0e402eaaed7fe14bfd638579d42fc16a2294614d20c8d065463ddd5b08","observation_id":"0f88185b-6004-4a3b-9ec1-e81652714fd7","resolution":{"observed_at":"2026-05-11T23:46:42.825400Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.18760","last_updated":"2024-11-01T14:37:37Z","snapshot_observed_at":"2026-07-06T16:55:09.267685Z","submitted_at":"2023-11-30T18:02:44Z","title":"TaskBench: Benchmarking Large Language Models for Task Automation","version":4},"cited_work":{"arxiv_id":"2311.18760","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2311.18760","snapshot_observed_at":"2026-07-03T21:18:59.738705Z","title":"name\" - concise snake_case identifier -","venue":null,"work_id":"b61538cd-9b66-42fd-831b-0f003ecaeb93","year":2023},"citing_paper":{"arxiv_id":"2605.07358","last_updated":"2026-05-26T05:21:04Z","snapshot_observed_at":"2026-07-06T23:19:46.018236Z","submitted_at":"2026-05-08T07:10:26Z","title":"A Comprehensive Survey on Agent Skills: Taxonomy, Techniques, and Applications","version":1},"reference_index":131,"source":"pdf_text","source_observed_at":"2026-05-11T01:47:39.926540Z"},"links":{"cited_paper":"/paper/2311.18760","citing_paper":"/paper/2605.07358"},"observation_digest":"sha256:ddf711c5b4cb8b8da3212091844bde695cafd15a99bb8a602d28662eb639d4fe","observation_id":"e3d1ed72-7b21-47d1-989a-8ca379ac76df","resolution":{"observed_at":"2026-05-11T04:20:57.226817Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.18760","last_updated":"2024-11-01T14:37:37Z","snapshot_observed_at":"2026-07-06T16:55:09.267685Z","submitted_at":"2023-11-30T18:02:44Z","title":"TaskBench: Benchmarking Large Language Models for Task Automation","version":4},"cited_work":{"arxiv_id":"2311.18760","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2311.18760","snapshot_observed_at":"2026-07-03T21:18:59.738705Z","title":"name\" - concise snake_case identifier -","venue":null,"work_id":"b61538cd-9b66-42fd-831b-0f003ecaeb93","year":2023},"citing_paper":{"arxiv_id":"2605.07358","last_updated":"2026-05-26T05:21:04Z","snapshot_observed_at":"2026-07-06T23:19:46.018236Z","submitted_at":"2026-05-08T07:10:26Z","title":"A Comprehensive Survey on Agent Skills: Taxonomy, Techniques, and Applications","version":2},"reference_index":133,"source":"pdf_text","source_observed_at":"2026-05-20T23:15:44.550045Z"},"links":{"cited_paper":"/paper/2311.18760","citing_paper":"/paper/2605.07358"},"observation_digest":"sha256:33be37b7323124b8ca79c885cded8a80231830804a5dc24222726ac9357a2bae","observation_id":"c36dc98e-b038-476c-a0da-8d5223a49814","resolution":{"observed_at":"2026-05-20T23:19:14.564249Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.18760","last_updated":"2024-11-01T14:37:37Z","snapshot_observed_at":"2026-07-06T16:55:09.267685Z","submitted_at":"2023-11-30T18:02:44Z","title":"TaskBench: Benchmarking Large Language Models for Task Automation","version":4},"cited_work":{"arxiv_id":"2311.18760","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2311.18760","snapshot_observed_at":"2026-07-03T21:18:59.738705Z","title":"name\" - concise snake_case identifier -","venue":null,"work_id":"b61538cd-9b66-42fd-831b-0f003ecaeb93","year":2023},"citing_paper":{"arxiv_id":"2605.07358","last_updated":"2026-05-26T05:21:04Z","snapshot_observed_at":"2026-07-06T23:19:46.018236Z","submitted_at":"2026-05-08T07:10:26Z","title":"A Comprehensive Survey on Agent Skills: Taxonomy, Techniques, and Applications","version":3},"reference_index":125,"source":"pdf_text","source_observed_at":"2026-06-30T23:23:42.883286Z"},"links":{"cited_paper":"/paper/2311.18760","citing_paper":"/paper/2605.07358"},"observation_digest":"sha256:4e62a8e71ee67c1100bea5f9a9a87a63a68a3deae0200badd6303d0d4c563f0b","observation_id":"f00eb9e9-5c6c-4fa8-840f-e52a854f5302","resolution":{"observed_at":"2026-06-30T23:25:07.428566Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.18760","last_updated":"2024-11-01T14:37:37Z","snapshot_observed_at":"2026-07-06T16:55:09.267685Z","submitted_at":"2023-11-30T18:02:44Z","title":"TaskBench: Benchmarking Large Language Models for Task Automation","version":4},"cited_work":{"arxiv_id":"2311.18760","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2311.18760","snapshot_observed_at":"2026-07-03T21:18:59.738705Z","title":"name\" - concise snake_case identifier -","venue":null,"work_id":"b61538cd-9b66-42fd-831b-0f003ecaeb93","year":2023},"citing_paper":{"arxiv_id":"2605.16508","last_updated":"2026-05-15T18:05:21Z","snapshot_observed_at":"2026-08-03T01:50:34.102829Z","submitted_at":"2026-05-15T18:05:21Z","title":"The Scaling Laws of Skills in LLM Agent Systems","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-20T18:10:08.737710Z"},"links":{"cited_paper":"/paper/2311.18760","citing_paper":"/paper/2605.16508"},"observation_digest":"sha256:d25d133f0821db5ed0f43129b9ed2e323d13b1562568e59a9e94a1707c7b1fc0","observation_id":"ba5974ba-b04f-4dc3-92ec-390f9993e4d4","resolution":{"observed_at":"2026-05-20T18:13:37.585700Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.18760","last_updated":"2024-11-01T14:37:37Z","snapshot_observed_at":"2026-07-06T16:55:09.267685Z","submitted_at":"2023-11-30T18:02:44Z","title":"TaskBench: Benchmarking Large Language Models for Task Automation","version":4},"cited_work":{"arxiv_id":"2311.18760","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2311.18760","snapshot_observed_at":"2026-07-03T21:18:59.738705Z","title":"name\" - concise snake_case identifier -","venue":null,"work_id":"b61538cd-9b66-42fd-831b-0f003ecaeb93","year":2023},"citing_paper":{"arxiv_id":"2605.16902","last_updated":"2026-05-16T09:26:08Z","snapshot_observed_at":"2026-08-08T15:59:13.953976Z","submitted_at":"2026-05-16T09:26:08Z","title":"ArtifactLinker: Linking Scientific Artifacts for Automatic State-of-the-Art Discovery","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-19T20:29:27.398862Z"},"links":{"cited_paper":"/paper/2311.18760","citing_paper":"/paper/2605.16902"},"observation_digest":"sha256:60d5ef7ebf6dbd27b97e5cda8e91912dde3c4648f605250137c436d08bf1b26f","observation_id":"5ca47bc0-0474-4ff5-a8e9-43e394bf85e4","resolution":{"observed_at":"2026-05-19T20:32:45.524880Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.18760","last_updated":"2024-11-01T14:37:37Z","snapshot_observed_at":"2026-07-06T16:55:09.267685Z","submitted_at":"2023-11-30T18:02:44Z","title":"TaskBench: Benchmarking Large Language Models for Task Automation","version":4},"cited_work":{"arxiv_id":"2311.18760","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2311.18760","snapshot_observed_at":"2026-07-03T21:18:59.738705Z","title":"name\" - concise snake_case identifier -","venue":null,"work_id":"b61538cd-9b66-42fd-831b-0f003ecaeb93","year":2023},"citing_paper":{"arxiv_id":"2605.25310","last_updated":"2026-05-25T00:16:32Z","snapshot_observed_at":"2026-08-08T15:40:38.352776Z","submitted_at":"2026-05-25T00:16:32Z","title":"Tool-Call Dependency Structure is Linearly Decodable in LLM Agent Residual Streams","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-06-29T23:09:59.207650Z"},"links":{"cited_paper":"/paper/2311.18760","citing_paper":"/paper/2605.25310"},"observation_digest":"sha256:3441652acd863ebd39077a07b64b30896835597367597d661ac9997b26864340","observation_id":"0c073145-80da-41e9-b334-c9fe81fe015e","resolution":{"observed_at":"2026-06-29T23:14:01.567575Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.18760","last_updated":"2024-11-01T14:37:37Z","snapshot_observed_at":"2026-07-06T16:55:09.267685Z","submitted_at":"2023-11-30T18:02:44Z","title":"TaskBench: Benchmarking Large Language Models for Task Automation","version":4},"cited_work":{"arxiv_id":"2311.18760","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2311.18760","snapshot_observed_at":"2026-07-03T21:18:59.738705Z","title":"name\" - concise snake_case identifier -","venue":null,"work_id":"b61538cd-9b66-42fd-831b-0f003ecaeb93","year":2023},"citing_paper":{"arxiv_id":"2606.11830","last_updated":"2026-06-10T09:13:10Z","snapshot_observed_at":"2026-08-07T15:34:57.329668Z","submitted_at":"2026-06-10T09:13:10Z","title":"Skill-Augmented AI Agents for Medical Research Analysis: An Exploratory Multi-Model Human Evaluation in an NSCLC Transcriptomic Biomarker Task","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-06-27T09:55:01.205573Z"},"links":{"cited_paper":"/paper/2311.18760","citing_paper":"/paper/2606.11830"},"observation_digest":"sha256:2c901c66af1b7ec176655fccb445bf87d38c7577e7b190e4165bea2ab1fc99b8","observation_id":"2f4cddb0-fea0-4544-bd36-1835165cd92e","resolution":{"observed_at":"2026-07-03T10:37:56.923529Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.18760","last_updated":"2024-11-01T14:37:37Z","snapshot_observed_at":"2026-07-06T16:55:09.267685Z","submitted_at":"2023-11-30T18:02:44Z","title":"TaskBench: Benchmarking Large Language Models for Task Automation","version":4},"cited_work":{"arxiv_id":"2311.18760","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2311.18760","snapshot_observed_at":"2026-07-03T21:18:59.738705Z","title":"name\" - concise snake_case identifier -","venue":null,"work_id":"b61538cd-9b66-42fd-831b-0f003ecaeb93","year":2023},"citing_paper":{"arxiv_id":"2606.18051","last_updated":"2026-06-16T15:27:55Z","snapshot_observed_at":"2026-08-07T03:31:46.971110Z","submitted_at":"2026-06-16T15:27:55Z","title":"Compositional Skill Routing for LLM Agents: Decompose, Retrieve, and Compose","version":1},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-06-27T00:37:50.570757Z"},"links":{"cited_paper":"/paper/2311.18760","citing_paper":"/paper/2606.18051"},"observation_digest":"sha256:5f7041742cfc7cb0f610c66fa231368bbaaac6d0f307fe788407b267b5f698cb","observation_id":"416983a5-6e59-45f4-81fd-e3a9e03315dc","resolution":{"observed_at":"2026-07-03T21:18:59.740372Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.18760","last_updated":"2024-11-01T14:37:37Z","snapshot_observed_at":"2026-07-06T16:55:09.267685Z","submitted_at":"2023-11-30T18:02:44Z","title":"TaskBench: Benchmarking Large Language Models for Task Automation","version":4},"cited_work":{"arxiv_id":"2311.18760","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2311.18760","snapshot_observed_at":"2026-07-03T21:18:59.738705Z","title":"name\" - concise snake_case identifier -","venue":null,"work_id":"b61538cd-9b66-42fd-831b-0f003ecaeb93","year":2023},"citing_paper":{"arxiv_id":"2606.31392","last_updated":"2026-06-30T09:19:38Z","snapshot_observed_at":"2026-07-07T00:05:07.912609Z","submitted_at":"2026-06-30T09:19:38Z","title":"ReGRPO: Reflection-Augmented Policy Optimization for Tool-Using Agents","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-07-01T05:23:21.162004Z"},"links":{"cited_paper":"/paper/2311.18760","citing_paper":"/paper/2606.31392"},"observation_digest":"sha256:025aac8ff15a1450bdd531e89effeaa934508b5ac002a4cc6055585bf89f0d11","observation_id":"0d6b121e-3485-4c8d-903d-5a29cc237600","resolution":{"observed_at":"2026-07-01T10:35:41.902511Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.18760","last_updated":"2024-11-01T14:37:37Z","snapshot_observed_at":"2026-07-06T16:55:09.267685Z","submitted_at":"2023-11-30T18:02:44Z","title":"TaskBench: Benchmarking Large Language Models for Task Automation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.18760","snapshot_observed_at":"2026-08-02T11:02:26.692134Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.26062","last_updated":"2026-06-16T20:30:06Z","snapshot_observed_at":"2026-08-09T04:02:11.497129Z","submitted_at":"2026-06-16T20:30:06Z","title":"Identifying Implicit Bias in LLM-based Chat AI Toward People with Intellectual Disabilities","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-02T11:02:26.692134Z"},"links":{"cited_paper":"/paper/2311.18760","citing_paper":"/paper/2607.26062"},"observation_digest":"sha256:004170a75828a96e4e60156a37cad1addba7a453ce868f4429ca53d551aea818","observation_id":"741ecbfb-e0ae-454d-9095-65ef8cbf5832","resolution":{"observed_at":"2026-08-02T11:02:26.692134Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2311.18760/citation-record","integrity":"/paper/2311.18760/integrity","json":"/paper/2311.18760/citation-record.json","paper":"/paper/2311.18760"},"outbound":[],"paper":{"arxiv_id":"2311.18760","last_updated":"2024-11-01T14:37:37Z","latest_version":4,"primary_category":"cs.CL","snapshot_observed_at":"2026-07-06T16:55:09.267685Z","submitted_at":"2023-11-30T18:02:44Z","title":"TaskBench: Benchmarking Large Language Models for Task Automation"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 18 inbound Pith citation observations for arXiv:2311.18760."}