{"as_of":"2026-08-17T21:46:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:acb951bbfe998dd98bb37573dbedfb3ff7fcf34d8dcb11398ec5346f794b0118","coverage":[{"denominator":53,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":53,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T04:44:06.111125Z","state":"measured"},{"denominator":57,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":57,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-17T06:30:58.91139+00:00","state":"measured"},{"denominator":4,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":4,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T04:44:28.494145Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-01T09:55:41.045115Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.13977","last_updated":"2025-06-11T17:59:18Z","snapshot_observed_at":"2026-08-17T10:45:33.058050Z","submitted_at":"2025-06-11T17:59:18Z","title":"CRITICTOOL: Evaluating Self-Critique Capabilities of Large Language Models in Tool-Calling Error Scenarios","version":1},"cited_work":{"arxiv_id":"2506.13977","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.13977","snapshot_observed_at":"2026-07-01T09:55:41.045115Z","title":"Carlos E","venue":null,"work_id":"1db5ecd2-4b06-41c7-9388-46a79ed37fb7","year":2024},"citing_paper":{"arxiv_id":"2604.05404","last_updated":"2026-04-14T06:24:16Z","snapshot_observed_at":"2026-08-12T22:54:50.552303Z","submitted_at":"2026-04-07T03:55:29Z","title":"Beyond Accuracy: Unveiling Inefficiency Patterns in Tool-Integrated Reasoning","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-10T19:24:46.023589Z"},"links":{"cited_paper":"/paper/2506.13977","citing_paper":"/paper/2604.05404"},"observation_digest":"sha256:3d40be00838cd3d157ee1dd74674892de98db5c8339115f47890f9a45ad51fd8","observation_id":"568c73ec-2278-4e24-ac49-9a81921e4d2b","resolution":{"observed_at":"2026-05-10T23:00:49.792116Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.13977","last_updated":"2025-06-11T17:59:18Z","snapshot_observed_at":"2026-08-17T10:45:33.058050Z","submitted_at":"2025-06-11T17:59:18Z","title":"CRITICTOOL: Evaluating Self-Critique Capabilities of Large Language Models in Tool-Calling Error Scenarios","version":1},"cited_work":{"arxiv_id":"2506.13977","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.13977","snapshot_observed_at":"2026-07-01T09:55:41.045115Z","title":"Carlos E","venue":null,"work_id":"1db5ecd2-4b06-41c7-9388-46a79ed37fb7","year":2024},"citing_paper":{"arxiv_id":"2606.28374","last_updated":"2026-06-17T14:53:36Z","snapshot_observed_at":"2026-08-12T22:53:59.869398Z","submitted_at":"2026-06-17T14:53:36Z","title":"Recursive Self-Evolving Agents via Held-Out Selection","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-06-30T11:13:15.923479Z"},"links":{"cited_paper":"/paper/2506.13977","citing_paper":"/paper/2606.28374"},"observation_digest":"sha256:a0413a8ffbb711a5a3f698312d68457eccfa1449a681c2e538d2b7b197423f9d","observation_id":"4904fd2f-b77a-4838-b57f-5cab4c0c216a","resolution":{"observed_at":"2026-06-30T11:14:37.523405Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.13977","last_updated":"2025-06-11T17:59:18Z","snapshot_observed_at":"2026-08-17T10:45:33.058050Z","submitted_at":"2025-06-11T17:59:18Z","title":"CRITICTOOL: Evaluating Self-Critique Capabilities of Large Language Models in Tool-Calling Error Scenarios","version":1},"cited_work":{"arxiv_id":"2506.13977","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.13977","snapshot_observed_at":"2026-07-01T09:55:41.045115Z","title":"Carlos E","venue":null,"work_id":"1db5ecd2-4b06-41c7-9388-46a79ed37fb7","year":2024},"citing_paper":{"arxiv_id":"2606.31504","last_updated":"2026-06-30T11:22:24Z","snapshot_observed_at":"2026-08-12T18:44:43.168315Z","submitted_at":"2026-06-30T11:22:24Z","title":"SimpleSearch-VL: A Simple Recipe for Multimodal Agentic Deep Search","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-07-01T06:02:48.532478Z"},"links":{"cited_paper":"/paper/2506.13977","citing_paper":"/paper/2606.31504"},"observation_digest":"sha256:87bb3965aea3d17be889454d7cfee20151ab01dd60b5fdb0f5c3edb1718bac50","observation_id":"1a7a4e19-1268-4d10-a232-8b4d46724ac3","resolution":{"observed_at":"2026-07-01T09:55:41.046656Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.13977","last_updated":"2025-06-11T17:59:18Z","snapshot_observed_at":"2026-08-17T10:45:33.058050Z","submitted_at":"2025-06-11T17:59:18Z","title":"CRITICTOOL: Evaluating Self-Critique Capabilities of Large Language Models in Tool-Calling Error Scenarios","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.13977","snapshot_observed_at":"2026-08-05T04:44:28.494145Z","title":"arXiv preprint arXiv:2506.13977 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03979","last_updated":"2026-08-04T17:45:16Z","snapshot_observed_at":"2026-08-17T01:10:46.970050Z","submitted_at":"2026-08-04T17:45:16Z","title":"Video-DeepResearch: Towards the Next-Generation Multimodal Deepresearch Agent","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-05T04:44:28.494145Z"},"links":{"cited_paper":"/paper/2506.13977","citing_paper":"/paper/2608.03979"},"observation_digest":"sha256:35b7833458508bb104ffffc4dc4ae1a0d10580e2477ab2a626e0bc8f1cf1548f","observation_id":"da4b10f7-2315-4881-8542-3bc14fb3835f","resolution":{"observed_at":"2026-08-05T04:44:28.494145Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2506.13977/citation-record","integrity":"/paper/2506.13977/integrity","json":"/paper/2506.13977/citation-record.json","paper":"/paper/2506.13977"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:44:09.738907Z","title":null,"venue":null,"work_id":"2d7542f8-509f-4525-9319-b4610bdbc6f2","year":2024},"citing_paper":{"arxiv_id":"2506.13977","last_updated":"2025-06-11T17:59:18Z","snapshot_observed_at":"2026-08-17T10:45:33.058050Z","submitted_at":"2025-06-11T17:59:18Z","title":"CRITICTOOL: Evaluating Self-Critique Capabilities of Large Language Models in Tool-Calling Error Scenarios","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-07T04:43:58.852016Z"},"links":{"citing_paper":"/paper/2506.13977"},"observation_digest":"sha256:ad5383b44b1d03a7a29c5c108a74984b72224687fcb616e7b4ba5977868f1c0b","observation_id":"217bbc1a-257d-4b69-9794-05b4d991820e","resolution":{"observed_at":"2026-08-07T04:44:09.812223Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:44:09.564125Z","title":null,"venue":null,"work_id":"aa8f5cce-00e7-49b4-b05a-009f28d506e2","year":2024},"citing_paper":{"arxiv_id":"2506.13977","last_updated":"2025-06-11T17:59:18Z","snapshot_observed_at":"2026-08-17T10:45:33.058050Z","submitted_at":"2025-06-11T17:59:18Z","title":"CRITICTOOL: Evaluating Self-Critique Capabilities of Large Language Models in Tool-Calling Error Scenarios","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-07T04:43:58.980243Z"},"links":{"citing_paper":"/paper/2506.13977"},"observation_digest":"sha256:479c8ee1d4bc9e4514aeb7f450f206766bdffb0b748f35ec3de470eeb963129e","observation_id":"0c0cfbec-79ff-4061-9b7b-227bdb64af60","resolution":{"observed_at":"2026-08-07T04:44:09.659430Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:44:09.408559Z","title":null,"venue":null,"work_id":"952679ef-bacf-4e0e-939a-bd2785e2bb3a","year":2024},"citing_paper":{"arxiv_id":"2506.13977","last_updated":"2025-06-11T17:59:18Z","snapshot_observed_at":"2026-08-17T10:45:33.058050Z","submitted_at":"2025-06-11T17:59:18Z","title":"CRITICTOOL: Evaluating Self-Critique Capabilities of Large Language Models in Tool-Calling Error Scenarios","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-07T04:43:59.122421Z"},"links":{"citing_paper":"/paper/2506.13977"},"observation_digest":"sha256:43e2545e8bf33aeea75cee148a11ee9610a347eb2d0cdd02987812fe1696ca2e","observation_id":"9f0377f4-e565-4569-89f6-490bbdc4321c","resolution":{"observed_at":"2026-08-07T04:44:09.477070Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.20689","last_updated":"2024-03-29T07:17:39Z","snapshot_observed_at":"2026-08-16T14:47:07.144931Z","submitted_at":"2023-10-31T17:52:22Z","title":"Learning From Mistakes Makes LLM Better Reasoner","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.20689","snapshot_observed_at":"2026-08-07T04:43:59.291125Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.13977","last_updated":"2025-06-11T17:59:18Z","snapshot_observed_at":"2026-08-17T10:45:33.058050Z","submitted_at":"2025-06-11T17:59:18Z","title":"CRITICTOOL: Evaluating Self-Critique Capabilities of Large Language Models in Tool-Calling Error Scenarios","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-07T04:43:59.291125Z"},"links":{"cited_paper":"/paper/2310.20689","citing_paper":"/paper/2506.13977"},"observation_digest":"sha256:5003693d8dab07a567f15144558ef752119bab3820997530aec328a7549e23c8","observation_id":"7fecc16b-e1d9-4ccc-a44f-8c7668226c5e","resolution":{"observed_at":"2026-08-07T04:43:59.291125Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:43:59.452589Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.13977","last_updated":"2025-06-11T17:59:18Z","snapshot_observed_at":"2026-08-17T10:45:33.058050Z","submitted_at":"2025-06-11T17:59:18Z","title":"CRITICTOOL: Evaluating Self-Critique Capabilities of Large Language Models in Tool-Calling Error Scenarios","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-07T04:43:59.452589Z"},"links":{"citing_paper":"/paper/2506.13977"},"observation_digest":"sha256:c9dda0e803b72c28210f16f4284c13fad6663ae8a579afbdd6810469a0a165dc","observation_id":"3fadd0eb-838a-4d0c-8203-639c4e8f39d3","resolution":{"observed_at":"2026-08-07T04:43:59.452589Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.14508","last_updated":"2024-06-19T04:00:32Z","snapshot_observed_at":"2026-08-08T03:49:18.086396Z","submitted_at":"2023-08-28T11:53:40Z","title":"LongBench: A Bilingual, Multitask Benchmark for Long Context Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.14508","snapshot_observed_at":"2026-08-07T04:43:59.669916Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.13977","last_updated":"2025-06-11T17:59:18Z","snapshot_observed_at":"2026-08-17T10:45:33.058050Z","submitted_at":"2025-06-11T17:59:18Z","title":"CRITICTOOL: Evaluating Self-Critique Capabilities of Large Language Models in Tool-Calling Error Scenarios","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-07T04:43:59.669916Z"},"links":{"cited_paper":"/paper/2308.14508","citing_paper":"/paper/2506.13977"},"observation_digest":"sha256:262d11e4f20d3ccb01fb3918eb15bbb63a938bd7574aded2f47ce54528fe30d6","observation_id":"f8c47a9e-9490-41e8-bc0f-24251e672eb8","resolution":{"observed_at":"2026-08-07T04:43:59.669916Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.03797","last_updated":"2025-05-21T04:36:42Z","snapshot_observed_at":"2026-08-16T13:21:19.529282Z","submitted_at":"2024-09-04T17:53:24Z","title":"NESTFUL: A Benchmark for Evaluating LLMs on Nested Sequences of API Calls","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.03797","snapshot_observed_at":"2026-08-07T04:43:59.849002Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.13977","last_updated":"2025-06-11T17:59:18Z","snapshot_observed_at":"2026-08-17T10:45:33.058050Z","submitted_at":"2025-06-11T17:59:18Z","title":"CRITICTOOL: Evaluating Self-Critique Capabilities of Large Language Models in Tool-Calling Error Scenarios","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-07T04:43:59.849002Z"},"links":{"cited_paper":"/paper/2409.03797","citing_paper":"/paper/2506.13977"},"observation_digest":"sha256:89a78ed108f9de5b36aafd526d2b61cc43bf084fd8b68d7e14876daa773eac41","observation_id":"845a9e89-81e7-41c7-a4e2-7771fdf4b6f8","resolution":{"observed_at":"2026-08-07T04:43:59.849002Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:44:00.072088Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.13977","last_updated":"2025-06-11T17:59:18Z","snapshot_observed_at":"2026-08-17T10:45:33.058050Z","submitted_at":"2025-06-11T17:59:18Z","title":"CRITICTOOL: Evaluating Self-Critique Capabilities of Large Language Models in Tool-Calling Error Scenarios","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-07T04:44:00.072088Z"},"links":{"citing_paper":"/paper/2506.13977"},"observation_digest":"sha256:6b279980d6bc71ba83efbd1ba2f40b2f1ca14adc87117bf37d8cfed5288b4e42","observation_id":"1654c7bc-fb7d-4a53-a740-21d386f76742","resolution":{"observed_at":"2026-08-07T04:44:00.072088Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.12793","last_updated":"2023-11-28T08:52:50Z","snapshot_observed_at":"2026-08-14T06:42:43.375489Z","submitted_at":"2023-11-21T18:58:11Z","title":"ShareGPT4V: Improving Large Multi-Modal Models with Better Captions","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.12793","snapshot_observed_at":"2026-08-07T04:44:00.225070Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.13977","last_updated":"2025-06-11T17:59:18Z","snapshot_observed_at":"2026-08-17T10:45:33.058050Z","submitted_at":"2025-06-11T17:59:18Z","title":"CRITICTOOL: Evaluating Self-Critique Capabilities of Large Language Models in Tool-Calling Error Scenarios","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-07T04:44:00.225070Z"},"links":{"cited_paper":"/paper/2311.12793","citing_paper":"/paper/2506.13977"},"observation_digest":"sha256:dd2afe84693879d47e3362b06105c04d8ea21ec37c84fbb97d5dd449873c3705","observation_id":"689c701e-040c-47bc-b1a0-7613609aef61","resolution":{"observed_at":"2026-08-07T04:44:00.225070Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.07115","last_updated":"2025-03-21T08:12:07Z","snapshot_observed_at":"2026-08-16T13:44:14.638875Z","submitted_at":"2024-06-11T10:00:18Z","title":"Advancing Tool-Augmented Large Language Models: Integrating Insights from Errors in Inference Trees","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.07115","snapshot_observed_at":"2026-08-07T04:44:00.419151Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.13977","last_updated":"2025-06-11T17:59:18Z","snapshot_observed_at":"2026-08-17T10:45:33.058050Z","submitted_at":"2025-06-11T17:59:18Z","title":"CRITICTOOL: Evaluating Self-Critique Capabilities of Large Language Models in Tool-Calling Error Scenarios","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-07T04:44:00.419151Z"},"links":{"cited_paper":"/paper/2406.07115","citing_paper":"/paper/2506.13977"},"observation_digest":"sha256:d6423e0566e1f4068ce9b6f0d770b0a57aae3db9b07a6967a1b26d750dbc7537","observation_id":"72fdc844-aeb9-4214-adb9-c7bfd31a1ef9","resolution":{"observed_at":"2026-08-07T04:44:00.419151Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:44:09.209539Z","title":null,"venue":null,"work_id":"bf96a17b-7c2c-4ad2-b96c-9ae15d46716e","year":2024},"citing_paper":{"arxiv_id":"2506.13977","last_updated":"2025-06-11T17:59:18Z","snapshot_observed_at":"2026-08-17T10:45:33.058050Z","submitted_at":"2025-06-11T17:59:18Z","title":"CRITICTOOL: Evaluating Self-Critique Capabilities of Large Language Models in Tool-Calling Error Scenarios","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-07T04:44:00.639866Z"},"links":{"citing_paper":"/paper/2506.13977"},"observation_digest":"sha256:e56e591dd5f20b021ea2b4b848e2166eb7febbf58d03ac251d4356816c8f16e7","observation_id":"e759c2be-f0f9-4544-99a3-e67b35b0900e","resolution":{"observed_at":"2026-08-07T04:44:09.292439Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:44:09.084659Z","title":null,"venue":null,"work_id":"476fae6b-db65-47b7-a6c1-0ae445e82d62","year":2024},"citing_paper":{"arxiv_id":"2506.13977","last_updated":"2025-06-11T17:59:18Z","snapshot_observed_at":"2026-08-17T10:45:33.058050Z","submitted_at":"2025-06-11T17:59:18Z","title":"CRITICTOOL: Evaluating Self-Critique Capabilities of Large Language Models in Tool-Calling Error Scenarios","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-07T04:44:00.793887Z"},"links":{"citing_paper":"/paper/2506.13977"},"observation_digest":"sha256:a08806251fffd577ac01485e77f09267e7a2e0c146f8993d4aca0f2d406fe886","observation_id":"ffd358cf-dc7e-4423-8913-b22c9e5d2a6e","resolution":{"observed_at":"2026-08-07T04:44:09.144833Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.12793","last_updated":"2024-07-30T03:58:11Z","snapshot_observed_at":"2026-08-14T09:56:00.692687Z","submitted_at":"2024-06-18T16:58:21Z","title":"ChatGLM: A Family of Large Language Models from GLM-130B to GLM-4 All Tools","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.12793","snapshot_observed_at":"2026-08-07T04:44:01.033520Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.13977","last_updated":"2025-06-11T17:59:18Z","snapshot_observed_at":"2026-08-17T10:45:33.058050Z","submitted_at":"2025-06-11T17:59:18Z","title":"CRITICTOOL: Evaluating Self-Critique Capabilities of Large Language Models in Tool-Calling Error Scenarios","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-07T04:44:01.033520Z"},"links":{"cited_paper":"/paper/2406.12793","citing_paper":"/paper/2506.13977"},"observation_digest":"sha256:78d1ffe82d9e6d7a277353b8876bd4b9ad4d48b4c5db2402e8bb7e369da71f83","observation_id":"eeb95397-334c-442f-8fbb-74addd9d7918","resolution":{"observed_at":"2026-08-07T04:44:01.033520Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.11738","last_updated":"2024-02-21T12:59:21Z","snapshot_observed_at":"2026-07-31T18:12:14.483728Z","submitted_at":"2023-05-19T15:19:44Z","title":"CRITIC: Large Language Models Can Self-Correct with Tool-Interactive Critiquing","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.11738","snapshot_observed_at":"2026-08-07T04:44:01.243326Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.13977","last_updated":"2025-06-11T17:59:18Z","snapshot_observed_at":"2026-08-17T10:45:33.058050Z","submitted_at":"2025-06-11T17:59:18Z","title":"CRITICTOOL: Evaluating Self-Critique Capabilities of Large Language Models in Tool-Calling Error Scenarios","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-07T04:44:01.243326Z"},"links":{"cited_paper":"/paper/2305.11738","citing_paper":"/paper/2506.13977"},"observation_digest":"sha256:f382a1ac1912d84777cf8ed9612a6501ad802539d542594cb2dd21c9c8d9cd50","observation_id":"c7931df2-f944-4b98-b455-0e7d77241325","resolution":{"observed_at":"2026-08-07T04:44:01.243326Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:44:08.944108Z","title":null,"venue":null,"work_id":"3ce29f98-4ac6-4448-bb37-efe9695dbfe0","year":2024},"citing_paper":{"arxiv_id":"2506.13977","last_updated":"2025-06-11T17:59:18Z","snapshot_observed_at":"2026-08-17T10:45:33.058050Z","submitted_at":"2025-06-11T17:59:18Z","title":"CRITICTOOL: Evaluating Self-Critique Capabilities of Large Language Models in Tool-Calling Error Scenarios","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-07T04:44:01.421439Z"},"links":{"citing_paper":"/paper/2506.13977"},"observation_digest":"sha256:806afa8b9684555254d5b3ebac1bf0ad56e7bd7c1641b1beb5cc23552e38c0df","observation_id":"7e7d13f1-3ad6-41a8-9b1b-52245361afbc","resolution":{"observed_at":"2026-08-07T04:44:09.019221Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:44:08.794581Z","title":null,"venue":null,"work_id":"f05ea977-89c8-45b6-b64f-49dc7b0f85b0","year":2024},"citing_paper":{"arxiv_id":"2506.13977","last_updated":"2025-06-11T17:59:18Z","snapshot_observed_at":"2026-08-17T10:45:33.058050Z","submitted_at":"2025-06-11T17:59:18Z","title":"CRITICTOOL: Evaluating Self-Critique Capabilities of Large Language Models in Tool-Calling Error Scenarios","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-07T04:44:01.644137Z"},"links":{"citing_paper":"/paper/2506.13977"},"observation_digest":"sha256:4879aba1b528b655e49e5eff14952de00971f8a05fdc570358fc2ef399fe6caf","observation_id":"d2444bff-9f8a-4a7e-a33c-c5eaed1e5a6d","resolution":{"observed_at":"2026-08-07T04:44:08.856039Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21276","last_updated":"2024-10-25T17:43:01Z","snapshot_observed_at":"2026-08-15T14:02:47.366139Z","submitted_at":"2024-10-25T17:43:01Z","title":"GPT-4o System Card","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.21276","snapshot_observed_at":"2026-08-07T04:44:01.792913Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.13977","last_updated":"2025-06-11T17:59:18Z","snapshot_observed_at":"2026-08-17T10:45:33.058050Z","submitted_at":"2025-06-11T17:59:18Z","title":"CRITICTOOL: Evaluating Self-Critique Capabilities of Large Language Models in Tool-Calling Error Scenarios","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-07T04:44:01.792913Z"},"links":{"cited_paper":"/paper/2410.21276","citing_paper":"/paper/2506.13977"},"observation_digest":"sha256:0b506aae7a034431f53659ea409fb853b8eb0c2b436e2d54750c2a121ce5b705","observation_id":"66880987-ac1e-4fc5-aa42-4bb68f4f11c0","resolution":{"observed_at":"2026-08-07T04:44:01.792913Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.00515","last_updated":"2024-11-10T22:02:27Z","snapshot_observed_at":"2026-08-14T16:40:35.729198Z","submitted_at":"2024-06-01T17:48:15Z","title":"A Survey on Large Language Models for Code Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.00515","snapshot_observed_at":"2026-08-07T04:44:01.993713Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.13977","last_updated":"2025-06-11T17:59:18Z","snapshot_observed_at":"2026-08-17T10:45:33.058050Z","submitted_at":"2025-06-11T17:59:18Z","title":"CRITICTOOL: Evaluating Self-Critique Capabilities of Large Language Models in Tool-Calling Error Scenarios","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-07T04:44:01.993713Z"},"links":{"cited_paper":"/paper/2406.00515","citing_paper":"/paper/2506.13977"},"observation_digest":"sha256:959384d330b2eec18e174aa11f22cb2a3a2853ab6af93d193764b91c54af349b","observation_id":"bac4134f-cf69-46af-9fee-3fc533a43831","resolution":{"observed_at":"2026-08-07T04:44:01.993713Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:44:08.657009Z","title":null,"venue":null,"work_id":"f37f6c0f-ed3d-47c8-b9ab-22c80cdeae85","year":2024},"citing_paper":{"arxiv_id":"2506.13977","last_updated":"2025-06-11T17:59:18Z","snapshot_observed_at":"2026-08-17T10:45:33.058050Z","submitted_at":"2025-06-11T17:59:18Z","title":"CRITICTOOL: Evaluating Self-Critique Capabilities of Large Language Models in Tool-Calling Error Scenarios","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-07T04:44:02.149884Z"},"links":{"citing_paper":"/paper/2506.13977"},"observation_digest":"sha256:7f2a7b4bea05c93de18e882510d268c71cc066b9cea2485170d1cd1b856c90d5","observation_id":"c834917b-d2d1-4eb4-8348-e13f40af22a9","resolution":{"observed_at":"2026-08-07T04:44:08.725540Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:44:08.476689Z","title":null,"venue":null,"work_id":"9c2a0887-4b4f-4618-9d86-bbcb51aabaef","year":2024},"citing_paper":{"arxiv_id":"2506.13977","last_updated":"2025-06-11T17:59:18Z","snapshot_observed_at":"2026-08-17T10:45:33.058050Z","submitted_at":"2025-06-11T17:59:18Z","title":"CRITICTOOL: Evaluating Self-Critique Capabilities of Large Language Models in Tool-Calling Error Scenarios","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-07T04:44:02.356201Z"},"links":{"citing_paper":"/paper/2506.13977"},"observation_digest":"sha256:5332e03e94ace44859da46b1da0b82fda621dad90dce34f0658595adea61691a","observation_id":"c7c21ec4-5f7a-43fd-b22e-34bb9c2be634","resolution":{"observed_at":"2026-08-07T04:44:08.575434Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.13764","last_updated":"2024-10-20T05:32:25Z","snapshot_observed_at":"2026-08-16T14:16:37.489348Z","submitted_at":"2024-02-21T12:38:59Z","title":"CriticEval: Evaluating Large Language Model as Critic","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.13764","snapshot_observed_at":"2026-08-07T04:44:02.536287Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.13977","last_updated":"2025-06-11T17:59:18Z","snapshot_observed_at":"2026-08-17T10:45:33.058050Z","submitted_at":"2025-06-11T17:59:18Z","title":"CRITICTOOL: Evaluating Self-Critique Capabilities of Large Language Models in Tool-Calling Error Scenarios","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-07T04:44:02.536287Z"},"links":{"cited_paper":"/paper/2402.13764","citing_paper":"/paper/2506.13977"},"observation_digest":"sha256:b743388010203374077a468dd05b1638efdb667c8d4e533194455d3f497ac44e","observation_id":"f3cafb9a-70c5-4a84-bdef-16b74ec4736e","resolution":{"observed_at":"2026-08-07T04:44:02.536287Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:44:08.362402Z","title":null,"venue":null,"work_id":"ba4d8973-2d12-41fd-bca5-df9cfcaf94ce","year":2023},"citing_paper":{"arxiv_id":"2506.13977","last_updated":"2025-06-11T17:59:18Z","snapshot_observed_at":"2026-08-17T10:45:33.058050Z","submitted_at":"2025-06-11T17:59:18Z","title":"CRITICTOOL: Evaluating Self-Critique Capabilities of Large Language Models in Tool-Calling Error Scenarios","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-07T04:44:02.662842Z"},"links":{"citing_paper":"/paper/2506.13977"},"observation_digest":"sha256:66cf3e69cc14e417954ad092e41db6d4f3fe6683d017c19274fac62e0fc43e4f","observation_id":"9c78a4a2-24f3-47c4-9a50-4634594879d9","resolution":{"observed_at":"2026-08-07T04:44:08.416356Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:44:08.222864Z","title":null,"venue":null,"work_id":"c97b8cc9-15fe-437e-b81c-6977e2825c7b","year":2024},"citing_paper":{"arxiv_id":"2506.13977","last_updated":"2025-06-11T17:59:18Z","snapshot_observed_at":"2026-08-17T10:45:33.058050Z","submitted_at":"2025-06-11T17:59:18Z","title":"CRITICTOOL: Evaluating Self-Critique Capabilities of Large Language Models in Tool-Calling Error Scenarios","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-07T04:44:02.813366Z"},"links":{"citing_paper":"/paper/2506.13977"},"observation_digest":"sha256:888688ad25086896d78a559c529f0d1cadcaf5c3ffdf9a38ad827e0284188797","observation_id":"7ce7f19c-92ea-4f12-b406-aa7f1353fe1a","resolution":{"observed_at":"2026-08-07T04:44:08.296384Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.00920","last_updated":"2025-07-25T08:26:54Z","snapshot_observed_at":"2026-08-16T13:22:13.710309Z","submitted_at":"2024-09-02T03:19:56Z","title":"ToolACE: Winning the Points of LLM Function Calling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.00920","snapshot_observed_at":"2026-08-07T04:44:02.936014Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.13977","last_updated":"2025-06-11T17:59:18Z","snapshot_observed_at":"2026-08-17T10:45:33.058050Z","submitted_at":"2025-06-11T17:59:18Z","title":"CRITICTOOL: Evaluating Self-Critique Capabilities of Large Language Models in Tool-Calling Error Scenarios","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-07T04:44:02.936014Z"},"links":{"cited_paper":"/paper/2409.00920","citing_paper":"/paper/2506.13977"},"observation_digest":"sha256:a55f741962168579d1288de222ee9c5de670e00f1211285a5f0b0193ad707740","observation_id":"acc7b5f5-65db-484e-bba3-d81f28142f86","resolution":{"observed_at":"2026-08-07T04:44:02.936014Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.00215","last_updated":"2024-06-28T19:53:17Z","snapshot_observed_at":"2026-08-16T13:38:37.638259Z","submitted_at":"2024-06-28T19:53:17Z","title":"LLM Critics Help Catch LLM Bugs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.00215","snapshot_observed_at":"2026-08-07T04:44:03.053326Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.13977","last_updated":"2025-06-11T17:59:18Z","snapshot_observed_at":"2026-08-17T10:45:33.058050Z","submitted_at":"2025-06-11T17:59:18Z","title":"CRITICTOOL: Evaluating Self-Critique Capabilities of Large Language Models in Tool-Calling Error Scenarios","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-07T04:44:03.053326Z"},"links":{"cited_paper":"/paper/2407.00215","citing_paper":"/paper/2506.13977"},"observation_digest":"sha256:b8f40b862093fb1d7fe0a123e580dd5b8d84f9b8c3651dc2b341ac2b25caf5ef","observation_id":"02bc1dfe-46d6-417a-bbef-fef24ef561b9","resolution":{"observed_at":"2026-08-07T04:44:03.053326Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:44:03.157613Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.13977","last_updated":"2025-06-11T17:59:18Z","snapshot_observed_at":"2026-08-17T10:45:33.058050Z","submitted_at":"2025-06-11T17:59:18Z","title":"CRITICTOOL: Evaluating Self-Critique Capabilities of Large Language Models in Tool-Calling Error Scenarios","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-07T04:44:03.157613Z"},"links":{"citing_paper":"/paper/2506.13977"},"observation_digest":"sha256:1ac2595b449e790e4da41b56a8c11d5bad3bd57450d70fe0c0a0cb10221b832f","observation_id":"7883b501-a81c-4491-9c33-e6e412c7962d","resolution":{"observed_at":"2026-08-07T04:44:03.157613Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:44:08.052778Z","title":null,"venue":null,"work_id":"dde2cb2a-4df7-4701-9041-bfb27a5911d3","year":2024},"citing_paper":{"arxiv_id":"2506.13977","last_updated":"2025-06-11T17:59:18Z","snapshot_observed_at":"2026-08-17T10:45:33.058050Z","submitted_at":"2025-06-11T17:59:18Z","title":"CRITICTOOL: Evaluating Self-Critique Capabilities of Large Language Models in Tool-Calling Error Scenarios","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-07T04:44:03.278928Z"},"links":{"citing_paper":"/paper/2506.13977"},"observation_digest":"sha256:b80dbb58ad1365e69d98c6924e0498d77f7f8ec95905bcb686419b7fd2f12127","observation_id":"8fbd3ae0-f63f-492b-a458-819abe786dac","resolution":{"observed_at":"2026-08-07T04:44:08.134734Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.15334","last_updated":"2023-05-24T16:48:11Z","snapshot_observed_at":"2026-08-14T14:07:14.900729Z","submitted_at":"2023-05-24T16:48:11Z","title":"Gorilla: Large Language Model Connected with Massive APIs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.15334","snapshot_observed_at":"2026-08-07T04:44:03.440975Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.13977","last_updated":"2025-06-11T17:59:18Z","snapshot_observed_at":"2026-08-17T10:45:33.058050Z","submitted_at":"2025-06-11T17:59:18Z","title":"CRITICTOOL: Evaluating Self-Critique Capabilities of Large Language Models in Tool-Calling Error Scenarios","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-07T04:44:03.440975Z"},"links":{"cited_paper":"/paper/2305.15334","citing_paper":"/paper/2506.13977"},"observation_digest":"sha256:72b284811c7b67f326ac54f9e21d00da1280e41b2f6a6b7f0b513b3b76638790","observation_id":"d1f1c625-1a6f-4184-94ef-08a192067740","resolution":{"observed_at":"2026-08-07T04:44:03.440975Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.16789","last_updated":"2023-10-03T14:45:48Z","snapshot_observed_at":"2026-08-16T04:18:30.717622Z","submitted_at":"2023-07-31T15:56:53Z","title":"ToolLLM: Facilitating Large Language Models to Master 16000+ Real-world APIs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.16789","snapshot_observed_at":"2026-08-07T04:44:03.514998Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.13977","last_updated":"2025-06-11T17:59:18Z","snapshot_observed_at":"2026-08-17T10:45:33.058050Z","submitted_at":"2025-06-11T17:59:18Z","title":"CRITICTOOL: Evaluating Self-Critique Capabilities of Large Language Models in Tool-Calling Error Scenarios","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-07T04:44:03.514998Z"},"links":{"cited_paper":"/paper/2307.16789","citing_paper":"/paper/2506.13977"},"observation_digest":"sha256:9d542baa4435f2130ff18bd53463a1753264b9e25ec34a76fbf101a4d0bd4180","observation_id":"93279016-7dd9-445e-adf8-3b5823caf82c","resolution":{"observed_at":"2026-08-07T04:44:03.514998Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.08197","last_updated":"2025-02-26T03:24:58Z","snapshot_observed_at":"2026-08-16T13:10:35.041011Z","submitted_at":"2024-10-10T17:58:44Z","title":"From Exploration to Mastery: Enabling LLMs to Master Tools via Self-Driven Interactions","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.08197","snapshot_observed_at":"2026-08-07T04:44:03.629843Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.13977","last_updated":"2025-06-11T17:59:18Z","snapshot_observed_at":"2026-08-17T10:45:33.058050Z","submitted_at":"2025-06-11T17:59:18Z","title":"CRITICTOOL: Evaluating Self-Critique Capabilities of Large Language Models in Tool-Calling Error Scenarios","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-07T04:44:03.629843Z"},"links":{"cited_paper":"/paper/2410.08197","citing_paper":"/paper/2506.13977"},"observation_digest":"sha256:b85c828e29bc4285eadfba2f183c54501e08ba79ad68af5c0319bf595eafb929","observation_id":"172fa7a8-5323-4f0a-bd87-b9e72adeaf4c","resolution":{"observed_at":"2026-08-07T04:44:03.629843Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1908.10084","last_updated":"2019-08-27T08:50:17Z","snapshot_observed_at":"2026-08-14T05:02:11.716316Z","submitted_at":"2019-08-27T08:50:17Z","title":"Sentence-BERT: Sentence Embeddings using Siamese BERT-Networks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1908.10084","snapshot_observed_at":"2026-08-07T04:44:03.752979Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.13977","last_updated":"2025-06-11T17:59:18Z","snapshot_observed_at":"2026-08-17T10:45:33.058050Z","submitted_at":"2025-06-11T17:59:18Z","title":"CRITICTOOL: Evaluating Self-Critique Capabilities of Large Language Models in Tool-Calling Error Scenarios","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-07T04:44:03.752979Z"},"links":{"cited_paper":"/paper/1908.10084","citing_paper":"/paper/2506.13977"},"observation_digest":"sha256:134f5843ff33b7576332c504b024655c0071e9ddbd09d3f9e2ebf8411c271619","observation_id":"8ffde937-60a1-4432-ac8b-4277c4bf7c0d","resolution":{"observed_at":"2026-08-07T04:44:03.752979Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.18760","last_updated":"2024-11-01T14:37:37Z","snapshot_observed_at":"2026-08-16T14:38:44.156876Z","submitted_at":"2023-11-30T18:02:44Z","title":"TaskBench: Benchmarking Large Language Models for Task Automation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.18760","snapshot_observed_at":"2026-08-07T04:44:03.797982Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.13977","last_updated":"2025-06-11T17:59:18Z","snapshot_observed_at":"2026-08-17T10:45:33.058050Z","submitted_at":"2025-06-11T17:59:18Z","title":"CRITICTOOL: Evaluating Self-Critique Capabilities of Large Language Models in Tool-Calling Error Scenarios","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-07T04:44:03.797982Z"},"links":{"cited_paper":"/paper/2311.18760","citing_paper":"/paper/2506.13977"},"observation_digest":"sha256:2c392ed1a46fc57f8404847f3d43bca9af09ab6b5252567935f45a56c8983f18","observation_id":"8a54ff64-1f1d-4520-a5f0-b99007a8a92c","resolution":{"observed_at":"2026-08-07T04:44:03.797982Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:44:03.906567Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.13977","last_updated":"2025-06-11T17:59:18Z","snapshot_observed_at":"2026-08-17T10:45:33.058050Z","submitted_at":"2025-06-11T17:59:18Z","title":"CRITICTOOL: Evaluating Self-Critique Capabilities of Large Language Models in Tool-Calling Error Scenarios","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-07T04:44:03.906567Z"},"links":{"citing_paper":"/paper/2506.13977"},"observation_digest":"sha256:9bc8a36c1e2a29c7d7410c4e768014be97341e55a04ca8caffe53b98327d9eff","observation_id":"1c5587e5-b660-4644-a920-f09aac92215f","resolution":{"observed_at":"2026-08-07T04:44:03.906567Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:44:07.888349Z","title":null,"venue":null,"work_id":"f16031d5-4dc3-45a3-9d60-ed187331374c","year":2024},"citing_paper":{"arxiv_id":"2506.13977","last_updated":"2025-06-11T17:59:18Z","snapshot_observed_at":"2026-08-17T10:45:33.058050Z","submitted_at":"2025-06-11T17:59:18Z","title":"CRITICTOOL: Evaluating Self-Critique Capabilities of Large Language Models in Tool-Calling Error Scenarios","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-07T04:44:03.984334Z"},"links":{"citing_paper":"/paper/2506.13977"},"observation_digest":"sha256:0be3519b238d8e5ed5158a60a00cf71b0b77a82180d6301437212028123af015","observation_id":"38c48ce5-9139-484e-8c75-e579e826ac76","resolution":{"observed_at":"2026-08-07T04:44:07.957618Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:44:07.758299Z","title":null,"venue":null,"work_id":"2e55019b-f949-4f49-a978-f6e96e162703","year":2024},"citing_paper":{"arxiv_id":"2506.13977","last_updated":"2025-06-11T17:59:18Z","snapshot_observed_at":"2026-08-17T10:45:33.058050Z","submitted_at":"2025-06-11T17:59:18Z","title":"CRITICTOOL: Evaluating Self-Critique Capabilities of Large Language Models in Tool-Calling Error Scenarios","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-07T04:44:04.079080Z"},"links":{"citing_paper":"/paper/2506.13977"},"observation_digest":"sha256:ba23d622fc8c4f6147bf036c0ca930b0f3709d39ca9b7c01014dda68405c266f","observation_id":"76a0d6b7-153b-412d-9ca2-33d62202f73e","resolution":{"observed_at":"2026-08-07T04:44:07.809782Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.10671","last_updated":"2024-09-10T13:25:53Z","snapshot_observed_at":"2026-08-17T11:08:48.802438Z","submitted_at":"2024-07-15T12:35:42Z","title":"Qwen2 Technical Report","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.10671","snapshot_observed_at":"2026-08-07T04:44:04.166038Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.13977","last_updated":"2025-06-11T17:59:18Z","snapshot_observed_at":"2026-08-17T10:45:33.058050Z","submitted_at":"2025-06-11T17:59:18Z","title":"CRITICTOOL: Evaluating Self-Critique Capabilities of Large Language Models in Tool-Calling Error Scenarios","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-07T04:44:04.166038Z"},"links":{"cited_paper":"/paper/2407.10671","citing_paper":"/paper/2506.13977"},"observation_digest":"sha256:dfaa313362d082708ab33d482e17104c9a24320bd416c8eafc102eb21047e740","observation_id":"0647b2b7-efd5-4d81-97fd-78b1d48a8f1e","resolution":{"observed_at":"2026-08-07T04:44:04.166038Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:44:04.305695Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.13977","last_updated":"2025-06-11T17:59:18Z","snapshot_observed_at":"2026-08-17T10:45:33.058050Z","submitted_at":"2025-06-11T17:59:18Z","title":"CRITICTOOL: Evaluating Self-Critique Capabilities of Large Language Models in Tool-Calling Error Scenarios","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-07T04:44:04.305695Z"},"links":{"citing_paper":"/paper/2506.13977"},"observation_digest":"sha256:296f10abea9ae9c468de4bcb7bf2d8afdfcf5a1f206798b435722261bb0b6ac0","observation_id":"47a6ee20-8ae0-4209-9e94-6ba84077b99c","resolution":{"observed_at":"2026-08-07T04:44:04.305695Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.12253","last_updated":"2024-12-10T18:19:29Z","snapshot_observed_at":"2026-08-17T03:24:15.091127Z","submitted_at":"2024-04-18T15:21:34Z","title":"Toward Self-Improvement of LLMs via Imagination, Searching, and Criticizing","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.12253","snapshot_observed_at":"2026-08-07T04:44:04.423186Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.13977","last_updated":"2025-06-11T17:59:18Z","snapshot_observed_at":"2026-08-17T10:45:33.058050Z","submitted_at":"2025-06-11T17:59:18Z","title":"CRITICTOOL: Evaluating Self-Critique Capabilities of Large Language Models in Tool-Calling Error Scenarios","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-07T04:44:04.423186Z"},"links":{"cited_paper":"/paper/2404.12253","citing_paper":"/paper/2506.13977"},"observation_digest":"sha256:bf3a402d2fd190c205c0fa89e36fbe418f7b0b97ae91ab5dac999292721c0859","observation_id":"780b2f58-8832-4486-844d-86d6bf3a3b8b","resolution":{"observed_at":"2026-08-07T04:44:04.423186Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:44:07.564849Z","title":null,"venue":null,"work_id":"ab37e27e-59bc-4755-9f4e-e01c41bcf525","year":2024},"citing_paper":{"arxiv_id":"2506.13977","last_updated":"2025-06-11T17:59:18Z","snapshot_observed_at":"2026-08-17T10:45:33.058050Z","submitted_at":"2025-06-11T17:59:18Z","title":"CRITICTOOL: Evaluating Self-Critique Capabilities of Large Language Models in Tool-Calling Error Scenarios","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-07T04:44:04.555717Z"},"links":{"citing_paper":"/paper/2506.13977"},"observation_digest":"sha256:33b4567449b9b7043d150de007f08b7fef89d5187caf50560ce793c9c7fb6114","observation_id":"5ae17871-d694-4766-815c-5583c4ebcb13","resolution":{"observed_at":"2026-08-07T04:44:07.649387Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.11443","last_updated":"2024-02-18T03:40:06Z","snapshot_observed_at":"2026-08-16T14:17:40.785468Z","submitted_at":"2024-02-18T03:40:06Z","title":"Benchmark Self-Evolving: A Multi-Agent Framework for Dynamic LLM Evaluation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.11443","snapshot_observed_at":"2026-08-07T04:44:04.671307Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.13977","last_updated":"2025-06-11T17:59:18Z","snapshot_observed_at":"2026-08-17T10:45:33.058050Z","submitted_at":"2025-06-11T17:59:18Z","title":"CRITICTOOL: Evaluating Self-Critique Capabilities of Large Language Models in Tool-Calling Error Scenarios","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-07T04:44:04.671307Z"},"links":{"cited_paper":"/paper/2402.11443","citing_paper":"/paper/2506.13977"},"observation_digest":"sha256:ada037e6518358f108b3989ac8b05093e34ce2c65d207c7a5d625a2fd22e7a50","observation_id":"e8efb481-ee2b-4016-ad62-e2f495fb91d5","resolution":{"observed_at":"2026-08-07T04:44:04.671307Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:44:07.415704Z","title":null,"venue":null,"work_id":"72b88ba9-c98a-47cb-b372-881f4e8c178e","year":2022},"citing_paper":{"arxiv_id":"2506.13977","last_updated":"2025-06-11T17:59:18Z","snapshot_observed_at":"2026-08-17T10:45:33.058050Z","submitted_at":"2025-06-11T17:59:18Z","title":"CRITICTOOL: Evaluating Self-Critique Capabilities of Large Language Models in Tool-Calling Error Scenarios","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-07T04:44:04.778585Z"},"links":{"citing_paper":"/paper/2506.13977"},"observation_digest":"sha256:df0f7ae730ad3471905edd1a664f954add7f550fe01576f9a70a1a427db148ab","observation_id":"7fd377a5-55a9-47e0-8e70-c03d14bd779f","resolution":{"observed_at":"2026-08-07T04:44:07.485880Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.16504","last_updated":"2023-05-25T22:10:20Z","snapshot_observed_at":"2026-08-16T15:29:32.108538Z","submitted_at":"2023-05-25T22:10:20Z","title":"On the Tool Manipulation Capability of Open-source Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.16504","snapshot_observed_at":"2026-08-07T04:44:04.866566Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.13977","last_updated":"2025-06-11T17:59:18Z","snapshot_observed_at":"2026-08-17T10:45:33.058050Z","submitted_at":"2025-06-11T17:59:18Z","title":"CRITICTOOL: Evaluating Self-Critique Capabilities of Large Language Models in Tool-Calling Error Scenarios","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-07T04:44:04.866566Z"},"links":{"cited_paper":"/paper/2305.16504","citing_paper":"/paper/2506.13977"},"observation_digest":"sha256:a457ad7c3c979952947dd89090e0c8c82201f3a086fe2a26f55f452e9a85d6f9","observation_id":"9a216b23-d2b7-4c7b-a3e1-e26f67b2ee8d","resolution":{"observed_at":"2026-08-07T04:44:04.866566Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:44:07.321400Z","title":"Patil, Ion Stoica, and Joseph E","venue":null,"work_id":"82d8a085-9bea-493f-923d-c2d779700073","year":2024},"citing_paper":{"arxiv_id":"2506.13977","last_updated":"2025-06-11T17:59:18Z","snapshot_observed_at":"2026-08-17T10:45:33.058050Z","submitted_at":"2025-06-11T17:59:18Z","title":"CRITICTOOL: Evaluating Self-Critique Capabilities of Large Language Models in Tool-Calling Error Scenarios","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-07T04:44:04.996971Z"},"links":{"citing_paper":"/paper/2506.13977"},"observation_digest":"sha256:b600082ff16fb14f4f4c96671c8ec646992c6741a9bb95c8ba15237da547eaac","observation_id":"12a6544b-3b5d-4ac5-802f-efc3b7c78a1e","resolution":{"observed_at":"2026-08-07T04:44:07.356573Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.11055","last_updated":"2024-10-14T20:01:52Z","snapshot_observed_at":"2026-08-16T13:09:25.901289Z","submitted_at":"2024-10-14T20:01:52Z","title":"Varying Shades of Wrong: Aligning LLMs with Wrong Answers Only","version":1},"cited_work":{"arxiv_id":"2410.11055","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.11055","snapshot_observed_at":"2026-08-07T04:44:06.297803Z","title":"Varying Shades of Wrong: Aligning LLMs with Wrong Answers Only","venue":"cs.CL","work_id":"faac436f-f36d-4144-8d86-d7ba2a6bbedf","year":2024},"citing_paper":{"arxiv_id":"2506.13977","last_updated":"2025-06-11T17:59:18Z","snapshot_observed_at":"2026-08-17T10:45:33.058050Z","submitted_at":"2025-06-11T17:59:18Z","title":"CRITICTOOL: Evaluating Self-Critique Capabilities of Large Language Models in Tool-Calling Error Scenarios","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-07T04:44:05.228437Z"},"links":{"cited_paper":"/paper/2410.11055","citing_paper":"/paper/2506.13977"},"observation_digest":"sha256:a2ab8cbd69a85b2e59305ef0df74f085b782f71615874f1b445d635c82ddbdbd","observation_id":"be33c64d-3ebd-4ac8-af3b-46dcf181c08c","resolution":{"observed_at":"2026-08-07T04:44:06.391470Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.00741","last_updated":"2024-12-05T07:05:59Z","snapshot_observed_at":"2026-08-16T17:40:14.613190Z","submitted_at":"2024-01-01T12:49:36Z","title":"ToolEyes: Fine-Grained Evaluation for Tool Learning Capabilities of Large Language Models in Real-world Scenarios","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.00741","snapshot_observed_at":"2026-08-07T04:44:05.285024Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.13977","last_updated":"2025-06-11T17:59:18Z","snapshot_observed_at":"2026-08-17T10:45:33.058050Z","submitted_at":"2025-06-11T17:59:18Z","title":"CRITICTOOL: Evaluating Self-Critique Capabilities of Large Language Models in Tool-Calling Error Scenarios","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-07T04:44:05.285024Z"},"links":{"cited_paper":"/paper/2401.00741","citing_paper":"/paper/2506.13977"},"observation_digest":"sha256:0d6e49bba910761d9f6b9a19e304a17ad6a859f1dca4db9139f6dd3c9b00aa19","observation_id":"b304eab5-2ffb-4dca-acf6-3cbcc9d960da","resolution":{"observed_at":"2026-08-07T04:44:05.285024Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:44:07.134742Z","title":null,"venue":null,"work_id":"2564e59e-0287-4546-9648-524cd833eabe","year":2024},"citing_paper":{"arxiv_id":"2506.13977","last_updated":"2025-06-11T17:59:18Z","snapshot_observed_at":"2026-08-17T10:45:33.058050Z","submitted_at":"2025-06-11T17:59:18Z","title":"CRITICTOOL: Evaluating Self-Critique Capabilities of Large Language Models in Tool-Calling Error Scenarios","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-07T04:44:05.392905Z"},"links":{"citing_paper":"/paper/2506.13977"},"observation_digest":"sha256:297fe817d8ee72a7d7421696bdace79a4a6d5d356867a297c2b0d21d85e6d626","observation_id":"f92ede64-81df-43ec-805d-2bc53fecf758","resolution":{"observed_at":"2026-08-07T04:44:07.227197Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:44:06.949584Z","title":null,"venue":null,"work_id":"f184d590-c170-455a-8afa-bc12582c0c11","year":2024},"citing_paper":{"arxiv_id":"2506.13977","last_updated":"2025-06-11T17:59:18Z","snapshot_observed_at":"2026-08-17T10:45:33.058050Z","submitted_at":"2025-06-11T17:59:18Z","title":"CRITICTOOL: Evaluating Self-Critique Capabilities of Large Language Models in Tool-Calling Error Scenarios","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-07T04:44:05.512316Z"},"links":{"citing_paper":"/paper/2506.13977"},"observation_digest":"sha256:eaef08bcfee1b76f6197c3d614a322a2d6f6c3cf23d14f861033abf564078dad","observation_id":"ef958cb6-c84d-4d1c-9d3d-11da26766dbf","resolution":{"observed_at":"2026-08-07T04:44:07.045908Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.06201","last_updated":"2024-03-27T06:31:42Z","snapshot_observed_at":"2026-08-16T14:28:11.216133Z","submitted_at":"2024-01-11T15:45:11Z","title":"EASYTOOL: Enhancing LLM-based Agents with Concise Tool Instruction","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.06201","snapshot_observed_at":"2026-08-07T04:44:05.615100Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.13977","last_updated":"2025-06-11T17:59:18Z","snapshot_observed_at":"2026-08-17T10:45:33.058050Z","submitted_at":"2025-06-11T17:59:18Z","title":"CRITICTOOL: Evaluating Self-Critique Capabilities of Large Language Models in Tool-Calling Error Scenarios","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-07T04:44:05.615100Z"},"links":{"cited_paper":"/paper/2401.06201","citing_paper":"/paper/2506.13977"},"observation_digest":"sha256:2a91e8876f03f4f7bed318a0a1ea6620660042d1d4d4b50423386835008d859b","observation_id":"c6049b07-f49e-4e96-9aed-d247befb0e8b","resolution":{"observed_at":"2026-08-07T04:44:05.615100Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.12823","last_updated":"2023-10-22T16:19:16Z","snapshot_observed_at":"2026-08-17T11:22:08.638027Z","submitted_at":"2023-10-19T15:19:53Z","title":"AgentTuning: Enabling Generalized Agent Abilities for LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.12823","snapshot_observed_at":"2026-08-07T04:44:05.694410Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.13977","last_updated":"2025-06-11T17:59:18Z","snapshot_observed_at":"2026-08-17T10:45:33.058050Z","submitted_at":"2025-06-11T17:59:18Z","title":"CRITICTOOL: Evaluating Self-Critique Capabilities of Large Language Models in Tool-Calling Error Scenarios","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-07T04:44:05.694410Z"},"links":{"cited_paper":"/paper/2310.12823","citing_paper":"/paper/2506.13977"},"observation_digest":"sha256:24329cd1b2f70fe1ab822e161b8e13e7a1c338951ef6538aacd029cbc52da59a","observation_id":"79c6ef08-dc2b-47df-8e58-ae41965ded89","resolution":{"observed_at":"2026-08-07T04:44:05.694410Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:44:06.705385Z","title":null,"venue":null,"work_id":"bc77329f-6e10-4278-bdb6-ec5d4d9b6919","year":2024},"citing_paper":{"arxiv_id":"2506.13977","last_updated":"2025-06-11T17:59:18Z","snapshot_observed_at":"2026-08-17T10:45:33.058050Z","submitted_at":"2025-06-11T17:59:18Z","title":"CRITICTOOL: Evaluating Self-Critique Capabilities of Large Language Models in Tool-Calling Error Scenarios","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-07T04:44:05.781953Z"},"links":{"citing_paper":"/paper/2506.13977"},"observation_digest":"sha256:3d54ff92b719fb656442335072197fa06bb4eac819a0c4dff672045f0908f115","observation_id":"c75468e2-0c74-43f0-aaa8-0b4cb451c5ef","resolution":{"observed_at":"2026-08-07T04:44:06.803432Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.18223","last_updated":"2026-03-18T05:34:39Z","snapshot_observed_at":"2026-08-14T10:40:26.323157Z","submitted_at":"2023-03-31T17:28:46Z","title":"A Survey of Large Language Models","version":19},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.18223","snapshot_observed_at":"2026-08-07T04:44:05.874236Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.13977","last_updated":"2025-06-11T17:59:18Z","snapshot_observed_at":"2026-08-17T10:45:33.058050Z","submitted_at":"2025-06-11T17:59:18Z","title":"CRITICTOOL: Evaluating Self-Critique Capabilities of Large Language Models in Tool-Calling Error Scenarios","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-07T04:44:05.874236Z"},"links":{"cited_paper":"/paper/2303.18223","citing_paper":"/paper/2506.13977"},"observation_digest":"sha256:a3af7c90f65c3a7125129e0e7492f456cdae1e98ffffa7b5bf27fa027aff4441","observation_id":"abf54ff6-b669-4a22-bb08-2eb7a92e59db","resolution":{"observed_at":"2026-08-07T04:44:05.874236Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:44:06.009699Z","title":"online\" 'onlinestring :=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.13977","last_updated":"2025-06-11T17:59:18Z","snapshot_observed_at":"2026-08-17T10:45:33.058050Z","submitted_at":"2025-06-11T17:59:18Z","title":"CRITICTOOL: Evaluating Self-Critique Capabilities of Large Language Models in Tool-Calling Error Scenarios","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-07T04:44:06.009699Z"},"links":{"citing_paper":"/paper/2506.13977"},"observation_digest":"sha256:6dd3ecc9f7097d4fb4e28155cca8870857fe77b2a877c1122bafbc0b4320d4ed","observation_id":"b177e4ee-7bfb-496a-b3b8-d879c4c037b6","resolution":{"observed_at":"2026-08-07T04:44:06.009699Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:44:06.111125Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.13977","last_updated":"2025-06-11T17:59:18Z","snapshot_observed_at":"2026-08-17T10:45:33.058050Z","submitted_at":"2025-06-11T17:59:18Z","title":"CRITICTOOL: Evaluating Self-Critique Capabilities of Large Language Models in Tool-Calling Error Scenarios","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-07T04:44:06.111125Z"},"links":{"citing_paper":"/paper/2506.13977"},"observation_digest":"sha256:1a9a292c13ca04a8f4ea6518d169ab18231ba55317a0753e056fce66bbffadc4","observation_id":"b76269b9-64a7-456d-af9e-e20f598c35dd","resolution":{"observed_at":"2026-08-07T04:44:06.111125Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2506.13977","last_updated":"2025-06-11T17:59:18Z","latest_version":1,"primary_category":"cs.SE","snapshot_observed_at":"2026-08-17T10:45:33.058050Z","submitted_at":"2025-06-11T17:59:18Z","title":"CRITICTOOL: Evaluating Self-Critique Capabilities of Large Language Models in Tool-Calling Error Scenarios"},"reference_resolution":{"displayed":53,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":51,"verified_exact":1,"verified_fuzzy":1},"total_outbound_references":53},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"thesis":"As of 17 August 2026, this Paper Citation Record lists 53 of 53 outbound references and 4 inbound Pith citation observations for arXiv:2506.13977."}