{"as_of":"2026-08-10T20:48:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:1dc9cdfd20b59a84a0fa525cd948fa572ffa1bf3957eecd15da5c2a6b9c98b27","coverage":[{"denominator":56,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":56,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T22:02:41.100115Z","state":"measured"},{"denominator":56,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":56,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2506.22853/citation-record","integrity":"/paper/2506.22853/integrity","json":"/paper/2506.22853/citation-record.json","paper":"/paper/2506.22853"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2407.00121","last_updated":"2024-06-27T17:47:26Z","snapshot_observed_at":"2026-08-09T02:44:34.826126Z","submitted_at":"2024-06-27T17:47:26Z","title":"Granite-Function Calling Model: Introducing Function Calling Abilities via Multi-task Learning of Granular Tasks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.00121","snapshot_observed_at":"2026-08-06T22:02:37.650566Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.22853","last_updated":"2025-07-02T07:55:09Z","snapshot_observed_at":"2026-08-09T18:57:10.167031Z","submitted_at":"2025-06-28T11:28:04Z","title":"DICE-BENCH: Evaluating the Tool-Use Capabilities of Large Language Models in Multi-Round, Multi-Party Dialogues","version":2},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-06T22:02:37.650566Z"},"links":{"cited_paper":"/paper/2407.00121","citing_paper":"/paper/2506.22853"},"observation_digest":"sha256:4d43df1c5ce869b792a23acc206bac02e29a316a52e0261571df9e348f020337","observation_id":"67af86c5-852a-4eab-9f36-fc04dcc5593f","resolution":{"observed_at":"2026-08-06T22:02:37.650566Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.08905","last_updated":"2024-12-12T03:37:41Z","snapshot_observed_at":"2026-08-05T04:04:21.846023Z","submitted_at":"2024-12-12T03:37:41Z","title":"Phi-4 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.08905","snapshot_observed_at":"2026-08-06T22:02:37.731201Z","title":"Hewett, Mojan Javaheripi, Piero Kauffmann, James R","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.22853","last_updated":"2025-07-02T07:55:09Z","snapshot_observed_at":"2026-08-09T18:57:10.167031Z","submitted_at":"2025-06-28T11:28:04Z","title":"DICE-BENCH: Evaluating the Tool-Use Capabilities of Large Language Models in Multi-Round, Multi-Party Dialogues","version":2},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-06T22:02:37.731201Z"},"links":{"cited_paper":"/paper/2412.08905","citing_paper":"/paper/2506.22853"},"observation_digest":"sha256:5381e469953d5cf5d5d4b4b4d28a7a52e6d6e0cfcc3a621332fae5641eb584d0","observation_id":"fb98c640-b9ef-4d10-b882-d412b61048b5","resolution":{"observed_at":"2026-08-06T22:02:37.731201Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.08820","last_updated":"2025-02-19T04:28:49Z","snapshot_observed_at":"2026-08-07T23:32:20.263382Z","submitted_at":"2025-02-12T22:18:34Z","title":"Can a Single Model Master Both Multi-turn Conversations and Tool Use? CoALM: A Unified Conversational Agentic Language Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.08820","snapshot_observed_at":"2026-08-06T22:02:37.849489Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.22853","last_updated":"2025-07-02T07:55:09Z","snapshot_observed_at":"2026-08-09T18:57:10.167031Z","submitted_at":"2025-06-28T11:28:04Z","title":"DICE-BENCH: Evaluating the Tool-Use Capabilities of Large Language Models in Multi-Round, Multi-Party Dialogues","version":2},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-06T22:02:37.849489Z"},"links":{"cited_paper":"/paper/2502.08820","citing_paper":"/paper/2506.22853"},"observation_digest":"sha256:004dc119ea9580a3237137d0239551464e6796e99e091ea0a65879e487ad568a","observation_id":"1263e47b-b410-4cc9-862a-b4c46cd4ebdd","resolution":{"observed_at":"2026-08-06T22:02:37.849489Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.15491","last_updated":"2024-05-20T14:52:31Z","snapshot_observed_at":"2026-08-10T02:47:32.829704Z","submitted_at":"2024-02-23T18:30:49Z","title":"API-BLEND: A Comprehensive Corpora for Training and Benchmarking API LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.15491","snapshot_observed_at":"2026-08-06T22:02:37.949602Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.22853","last_updated":"2025-07-02T07:55:09Z","snapshot_observed_at":"2026-08-09T18:57:10.167031Z","submitted_at":"2025-06-28T11:28:04Z","title":"DICE-BENCH: Evaluating the Tool-Use Capabilities of Large Language Models in Multi-Round, Multi-Party Dialogues","version":2},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-06T22:02:37.949602Z"},"links":{"cited_paper":"/paper/2402.15491","citing_paper":"/paper/2506.22853"},"observation_digest":"sha256:a0f7e06175f97542d206fa1706c34bca8e9a2abef7ff267a14fdabf5af2c2337","observation_id":"ace2d624-af41-4043-99fc-7f8c256c5689","resolution":{"observed_at":"2026-08-06T22:02:37.949602Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:02:45.168250Z","title":null,"venue":null,"work_id":"2a0ae983-129c-4d69-b7ca-9dbddcca97f9","year":2011},"citing_paper":{"arxiv_id":"2506.22853","last_updated":"2025-07-02T07:55:09Z","snapshot_observed_at":"2026-08-09T18:57:10.167031Z","submitted_at":"2025-06-28T11:28:04Z","title":"DICE-BENCH: Evaluating the Tool-Use Capabilities of Large Language Models in Multi-Round, Multi-Party Dialogues","version":2},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-06T22:02:38.066276Z"},"links":{"citing_paper":"/paper/2506.22853"},"observation_digest":"sha256:83fb77c18249604390c4f6d381e0a7ee67155c67c78bd55f2a6a00099d5c2abd","observation_id":"07f59721-6407-409e-955d-616765d4661a","resolution":{"observed_at":"2026-08-06T22:02:45.244990Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1904.09020","last_updated":"2019-04-18T21:33:15Z","snapshot_observed_at":"2026-08-09T11:09:02.059424Z","submitted_at":"2019-04-18T21:33:15Z","title":"Genie: A Generator of Natural Language Semantic Parsers for Virtual Assistant Commands","version":1},"cited_work":{"arxiv_id":"1904.09020","doi":null,"metadata_source":"pith","pith_arxiv_id":"1904.09020","snapshot_observed_at":"2026-08-06T22:02:43.004938Z","title":"Genie: A Generator of Natural Language Semantic Parsers for Virtual Assistant Commands","venue":"cs.CL","work_id":"695fd097-f784-487f-b79e-43e412561677","year":2019},"citing_paper":{"arxiv_id":"2506.22853","last_updated":"2025-07-02T07:55:09Z","snapshot_observed_at":"2026-08-09T18:57:10.167031Z","submitted_at":"2025-06-28T11:28:04Z","title":"DICE-BENCH: Evaluating the Tool-Use Capabilities of Large Language Models in Multi-Round, Multi-Party Dialogues","version":2},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-06T22:02:38.215072Z"},"links":{"cited_paper":"/paper/1904.09020","citing_paper":"/paper/2506.22853"},"observation_digest":"sha256:d734d63b0a92028728d5da444dfad59930a3f7b5f3545f5fe3934e2876e9331e","observation_id":"ee157638-d7a2-4999-a40a-7d55726c6ca0","resolution":{"observed_at":"2026-08-06T22:02:43.088698Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.14033","last_updated":"2024-01-15T03:18:25Z","snapshot_observed_at":"2026-07-06T17:06:37.369542Z","submitted_at":"2023-12-21T17:02:06Z","title":"T-Eval: Evaluating the Tool Utilization Capability of Large Language Models Step by Step","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.14033","snapshot_observed_at":"2026-08-06T22:02:38.371492Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.22853","last_updated":"2025-07-02T07:55:09Z","snapshot_observed_at":"2026-08-09T18:57:10.167031Z","submitted_at":"2025-06-28T11:28:04Z","title":"DICE-BENCH: Evaluating the Tool-Use Capabilities of Large Language Models in Multi-Round, Multi-Party Dialogues","version":2},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-06T22:02:38.371492Z"},"links":{"cited_paper":"/paper/2312.14033","citing_paper":"/paper/2506.22853"},"observation_digest":"sha256:50225a8086e87dfc30bdf6cf043e0eb539b264227fdec36d38c99f0f87202c4b","observation_id":"6512ffbd-b7dd-481e-88e9-49d88c10eb49","resolution":{"observed_at":"2026-08-06T22:02:38.371492Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.00608","last_updated":"2024-10-25T01:16:55Z","snapshot_observed_at":"2026-08-09T23:57:20.741725Z","submitted_at":"2024-09-01T04:23:48Z","title":"TinyAgent: Function Calling at the Edge","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.00608","snapshot_observed_at":"2026-08-06T22:02:38.481560Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.22853","last_updated":"2025-07-02T07:55:09Z","snapshot_observed_at":"2026-08-09T18:57:10.167031Z","submitted_at":"2025-06-28T11:28:04Z","title":"DICE-BENCH: Evaluating the Tool-Use Capabilities of Large Language Models in Multi-Round, Multi-Party Dialogues","version":2},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-06T22:02:38.481560Z"},"links":{"cited_paper":"/paper/2409.00608","citing_paper":"/paper/2506.22853"},"observation_digest":"sha256:67ed9cd6b9bba24b4955d11571e52f91f381d2e603692338e16ae527e86ce77e","observation_id":"eaa1891e-46d6-412f-9683-9fdaeac463ce","resolution":{"observed_at":"2026-08-06T22:02:38.481560Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.10775","last_updated":"2023-11-15T23:50:31Z","snapshot_observed_at":"2026-08-10T01:11:09.836653Z","submitted_at":"2023-11-15T23:50:31Z","title":"ToolTalk: Evaluating Tool-Usage in a Conversational Setting","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.10775","snapshot_observed_at":"2026-08-06T22:02:38.534202Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.22853","last_updated":"2025-07-02T07:55:09Z","snapshot_observed_at":"2026-08-09T18:57:10.167031Z","submitted_at":"2025-06-28T11:28:04Z","title":"DICE-BENCH: Evaluating the Tool-Use Capabilities of Large Language Models in Multi-Round, Multi-Party Dialogues","version":2},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-06T22:02:38.534202Z"},"links":{"cited_paper":"/paper/2311.10775","citing_paper":"/paper/2506.22853"},"observation_digest":"sha256:d0e343beecedf31650f1615cdc2bdff08959b59212f73db59154a90f2b2a2f98","observation_id":"b7820be4-1746-493c-bf47-d3385e69a83e","resolution":{"observed_at":"2026-08-06T22:02:38.534202Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.12793","last_updated":"2024-07-30T03:58:11Z","snapshot_observed_at":"2026-08-07T13:56:34.167869Z","submitted_at":"2024-06-18T16:58:21Z","title":"ChatGLM: A Family of Large Language Models from GLM-130B to GLM-4 All Tools","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.12793","snapshot_observed_at":"2026-08-06T22:02:38.574014Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.22853","last_updated":"2025-07-02T07:55:09Z","snapshot_observed_at":"2026-08-09T18:57:10.167031Z","submitted_at":"2025-06-28T11:28:04Z","title":"DICE-BENCH: Evaluating the Tool-Use Capabilities of Large Language Models in Multi-Round, Multi-Party Dialogues","version":2},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-06T22:02:38.574014Z"},"links":{"cited_paper":"/paper/2406.12793","citing_paper":"/paper/2506.22853"},"observation_digest":"sha256:c87a9bd98811062691d5ce086c7d9b2f2346ba36203b6ce12933f5736c3a1823","observation_id":"f8a22051-a2c3-4fc7-9b9b-e797ebfe2b16","resolution":{"observed_at":"2026-08-06T22:02:38.574014Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.00402","last_updated":"2025-07-06T08:13:18Z","snapshot_observed_at":"2026-08-07T20:36:45.056471Z","submitted_at":"2024-06-29T11:09:47Z","title":"Is It Really Long Context if All You Need Is Retrieval? Towards Genuinely Difficult Long Context NLP","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.00402","snapshot_observed_at":"2026-08-06T22:02:38.627939Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.22853","last_updated":"2025-07-02T07:55:09Z","snapshot_observed_at":"2026-08-09T18:57:10.167031Z","submitted_at":"2025-06-28T11:28:04Z","title":"DICE-BENCH: Evaluating the Tool-Use Capabilities of Large Language Models in Multi-Round, Multi-Party Dialogues","version":2},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-06T22:02:38.627939Z"},"links":{"cited_paper":"/paper/2407.00402","citing_paper":"/paper/2506.22853"},"observation_digest":"sha256:20f14a909dcc5d93a361b645798991114ed69e179707c6a8694b0561b3d11d47","observation_id":"f7cbef17-dec1-4b55-b70c-7db2756b1bc5","resolution":{"observed_at":"2026-08-06T22:02:38.627939Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.06360","last_updated":"2024-02-09T12:10:00Z","snapshot_observed_at":"2026-08-09T12:08:25.829927Z","submitted_at":"2024-02-09T12:10:00Z","title":"CoSearchAgent: A Lightweight Collaborative Search Agent with Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.06360","snapshot_observed_at":"2026-08-06T22:02:38.725718Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.22853","last_updated":"2025-07-02T07:55:09Z","snapshot_observed_at":"2026-08-09T18:57:10.167031Z","submitted_at":"2025-06-28T11:28:04Z","title":"DICE-BENCH: Evaluating the Tool-Use Capabilities of Large Language Models in Multi-Round, Multi-Party Dialogues","version":2},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-06T22:02:38.725718Z"},"links":{"cited_paper":"/paper/2402.06360","citing_paper":"/paper/2506.22853"},"observation_digest":"sha256:7718887d3f6c440c0ad494183e2e45d91753046f0b011ef93d55d14fcccc6b19","observation_id":"140e6b49-c3e1-4f90-99d9-53875517b35e","resolution":{"observed_at":"2026-08-06T22:02:38.725718Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.06677","last_updated":"2023-12-04T07:51:58Z","snapshot_observed_at":"2026-07-06T17:00:00.321552Z","submitted_at":"2023-12-04T07:51:58Z","title":"Intelligent Virtual Assistants with LLM-based Process Automation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.06677","snapshot_observed_at":"2026-08-06T22:02:38.797381Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.22853","last_updated":"2025-07-02T07:55:09Z","snapshot_observed_at":"2026-08-09T18:57:10.167031Z","submitted_at":"2025-06-28T11:28:04Z","title":"DICE-BENCH: Evaluating the Tool-Use Capabilities of Large Language Models in Multi-Round, Multi-Party Dialogues","version":2},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-06T22:02:38.797381Z"},"links":{"cited_paper":"/paper/2312.06677","citing_paper":"/paper/2506.22853"},"observation_digest":"sha256:2ec80346d5043a2ec4d520e6546339cf9f963c03079bbb4d9a74b291946a0bd0","observation_id":"64c732c0-1389-4afa-8e90-b22d0b70dc3b","resolution":{"observed_at":"2026-08-06T22:02:38.797381Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.03128","last_updated":"2024-12-04T19:49:02Z","snapshot_observed_at":"2026-07-06T16:27:55.509482Z","submitted_at":"2023-10-04T19:39:26Z","title":"MetaTool Benchmark for Large Language Models: Deciding Whether to Use Tools and Which to Use","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.03128","snapshot_observed_at":"2026-08-06T22:02:38.861022Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.22853","last_updated":"2025-07-02T07:55:09Z","snapshot_observed_at":"2026-08-09T18:57:10.167031Z","submitted_at":"2025-06-28T11:28:04Z","title":"DICE-BENCH: Evaluating the Tool-Use Capabilities of Large Language Models in Multi-Round, Multi-Party Dialogues","version":2},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-06T22:02:38.861022Z"},"links":{"cited_paper":"/paper/2310.03128","citing_paper":"/paper/2506.22853"},"observation_digest":"sha256:8e2df30eba01b4b1528f205ca6007eec6df9b0393ca6351a2d329bf1dc19b9bb","observation_id":"20756517-6596-4bec-9837-d139ff5bdd0b","resolution":{"observed_at":"2026-08-06T22:02:38.861022Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.16643","last_updated":"2025-03-18T06:39:36Z","snapshot_observed_at":"2026-08-10T11:40:13.867695Z","submitted_at":"2025-01-28T02:27:55Z","title":"An LLM Benchmark for Addressee Recognition in Multi-modal Multi-party Dialogue","version":2},"cited_work":{"arxiv_id":"2501.16643","doi":null,"metadata_source":"pith","pith_arxiv_id":"2501.16643","snapshot_observed_at":"2026-08-06T22:02:42.559862Z","title":"An LLM Benchmark for Addressee Recognition in Multi-modal Multi-party Dialogue","venue":"cs.CL","work_id":"0ca8f355-1e66-41c1-af71-020c8e47b5f3","year":2025},"citing_paper":{"arxiv_id":"2506.22853","last_updated":"2025-07-02T07:55:09Z","snapshot_observed_at":"2026-08-09T18:57:10.167031Z","submitted_at":"2025-06-28T11:28:04Z","title":"DICE-BENCH: Evaluating the Tool-Use Capabilities of Large Language Models in Multi-Round, Multi-Party Dialogues","version":2},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-06T22:02:38.931012Z"},"links":{"cited_paper":"/paper/2501.16643","citing_paper":"/paper/2506.22853"},"observation_digest":"sha256:e8ba6cf952845fa8b6c0f8acd0afbf234cb63b32ca6148378306843e5c01890f","observation_id":"17b10d36-0521-4cdb-9bc0-99c1e690b5a6","resolution":{"observed_at":"2026-08-06T22:02:42.730281Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06825","last_updated":"2023-10-10T17:54:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-10T17:54:58Z","title":"Mistral 7B","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06825","snapshot_observed_at":"2026-08-06T22:02:38.975216Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.22853","last_updated":"2025-07-02T07:55:09Z","snapshot_observed_at":"2026-08-09T18:57:10.167031Z","submitted_at":"2025-06-28T11:28:04Z","title":"DICE-BENCH: Evaluating the Tool-Use Capabilities of Large Language Models in Multi-Round, Multi-Party Dialogues","version":2},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-06T22:02:38.975216Z"},"links":{"cited_paper":"/paper/2310.06825","citing_paper":"/paper/2506.22853"},"observation_digest":"sha256:b477da1fbe70b6ed08092bee5ea40e19fa12b1cbdcc157fc2b040f5b3969a582","observation_id":"1890a7c7-d408-4896-9b3f-b6f43833978d","resolution":{"observed_at":"2026-08-06T22:02:38.975216Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:02:44.982510Z","title":null,"venue":null,"work_id":"6b0fcb03-907a-44dc-a0eb-189d948ced16","year":2019},"citing_paper":{"arxiv_id":"2506.22853","last_updated":"2025-07-02T07:55:09Z","snapshot_observed_at":"2026-08-09T18:57:10.167031Z","submitted_at":"2025-06-28T11:28:04Z","title":"DICE-BENCH: Evaluating the Tool-Use Capabilities of Large Language Models in Multi-Round, Multi-Party Dialogues","version":2},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-06T22:02:39.071046Z"},"links":{"citing_paper":"/paper/2506.22853"},"observation_digest":"sha256:992f08b9ce3cb6175aa74fe0a2eb6a4252137dcdb5ade0008ae605687e8552e4","observation_id":"9920ca20-b5c2-400f-a140-a0c3904cd7f0","resolution":{"observed_at":"2026-08-06T22:02:45.073905Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.08030","last_updated":"2024-02-12T19:49:58Z","snapshot_observed_at":"2026-07-06T17:29:08.902766Z","submitted_at":"2024-02-12T19:49:58Z","title":"Why and When LLM-Based Assistants Can Go Wrong: Investigating the Effectiveness of Prompt-Based Interactions for Software Help-Seeking","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.08030","snapshot_observed_at":"2026-08-06T22:02:39.143917Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.22853","last_updated":"2025-07-02T07:55:09Z","snapshot_observed_at":"2026-08-09T18:57:10.167031Z","submitted_at":"2025-06-28T11:28:04Z","title":"DICE-BENCH: Evaluating the Tool-Use Capabilities of Large Language Models in Multi-Round, Multi-Party Dialogues","version":2},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-06T22:02:39.143917Z"},"links":{"cited_paper":"/paper/2402.08030","citing_paper":"/paper/2506.22853"},"observation_digest":"sha256:eec709b73d7c58232dfac4bb4cfd9962462127d779fe5423f18cfc78f303c2ba","observation_id":"abb7d8da-005f-4b43-89b6-c9ed2ea968b6","resolution":{"observed_at":"2026-08-06T22:02:39.143917Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.15523","last_updated":"2024-09-23T20:16:49Z","snapshot_observed_at":"2026-08-06T04:34:39.639678Z","submitted_at":"2024-09-23T20:16:49Z","title":"SEAL: Suite for Evaluating API-use of LLMs","version":1},"cited_work":{"arxiv_id":"2409.15523","doi":null,"metadata_source":"pith","pith_arxiv_id":"2409.15523","snapshot_observed_at":"2026-08-06T22:02:42.319476Z","title":"SEAL: Suite for Evaluating API-use of LLMs","venue":"cs.AI","work_id":"7e02d7b5-a3fd-4a84-b628-cbe24baa22ea","year":2024},"citing_paper":{"arxiv_id":"2506.22853","last_updated":"2025-07-02T07:55:09Z","snapshot_observed_at":"2026-08-09T18:57:10.167031Z","submitted_at":"2025-06-28T11:28:04Z","title":"DICE-BENCH: Evaluating the Tool-Use Capabilities of Large Language Models in Multi-Round, Multi-Party Dialogues","version":2},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-06T22:02:39.212803Z"},"links":{"cited_paper":"/paper/2409.15523","citing_paper":"/paper/2506.22853"},"observation_digest":"sha256:f4a2fa2244d017e3c31af2338f5d85ddd7143eb3f099a769d99f4269510a20c7","observation_id":"cce720a0-115d-4a8e-88d7-e34a0c75fab4","resolution":{"observed_at":"2026-08-06T22:02:42.398827Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.16848","last_updated":"2025-02-27T08:15:49Z","snapshot_observed_at":"2026-07-06T19:37:42.469688Z","submitted_at":"2024-10-22T09:35:42Z","title":"ETHIC: Evaluating Large Language Models on Long-Context Tasks with High Information Coverage","version":2},"cited_work":{"arxiv_id":"2410.16848","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.16848","snapshot_observed_at":"2026-08-06T22:02:42.098639Z","title":"ETHIC: Evaluating Large Language Models on Long-Context Tasks with High Information Coverage","venue":"cs.CL","work_id":"43a82d57-cd66-4a63-9401-5d0abdce6d09","year":2024},"citing_paper":{"arxiv_id":"2506.22853","last_updated":"2025-07-02T07:55:09Z","snapshot_observed_at":"2026-08-09T18:57:10.167031Z","submitted_at":"2025-06-28T11:28:04Z","title":"DICE-BENCH: Evaluating the Tool-Use Capabilities of Large Language Models in Multi-Round, Multi-Party Dialogues","version":2},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-06T22:02:39.273106Z"},"links":{"cited_paper":"/paper/2410.16848","citing_paper":"/paper/2506.22853"},"observation_digest":"sha256:3026204877715c6fa5a556ddaef479aacc09c97280d8e1b3c3dd237f51d1fa1b","observation_id":"6ac36575-d17c-4731-8683-e28c29e9355e","resolution":{"observed_at":"2026-08-06T22:02:42.211387Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.08244","last_updated":"2023-10-25T06:54:12Z","snapshot_observed_at":"2026-08-02T00:07:12.855748Z","submitted_at":"2023-04-14T14:05:32Z","title":"API-Bank: A Comprehensive Benchmark for Tool-Augmented LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.08244","snapshot_observed_at":"2026-08-06T22:02:39.336321Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.22853","last_updated":"2025-07-02T07:55:09Z","snapshot_observed_at":"2026-08-09T18:57:10.167031Z","submitted_at":"2025-06-28T11:28:04Z","title":"DICE-BENCH: Evaluating the Tool-Use Capabilities of Large Language Models in Multi-Round, Multi-Party Dialogues","version":2},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-06T22:02:39.336321Z"},"links":{"cited_paper":"/paper/2304.08244","citing_paper":"/paper/2506.22853"},"observation_digest":"sha256:e3c1482bc3b774ab0f83abf76eb2e352626c60bbcd73ebe73c666f52060890c8","observation_id":"a4d59512-941d-4138-8afd-e64b0a39d3d4","resolution":{"observed_at":"2026-08-06T22:02:39.336321Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.00920","last_updated":"2025-07-25T08:26:54Z","snapshot_observed_at":"2026-08-07T03:58:38.931628Z","submitted_at":"2024-09-02T03:19:56Z","title":"ToolACE: Winning the Points of LLM Function Calling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.00920","snapshot_observed_at":"2026-08-06T22:02:39.409173Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.22853","last_updated":"2025-07-02T07:55:09Z","snapshot_observed_at":"2026-08-09T18:57:10.167031Z","submitted_at":"2025-06-28T11:28:04Z","title":"DICE-BENCH: Evaluating the Tool-Use Capabilities of Large Language Models in Multi-Round, Multi-Party Dialogues","version":2},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-06T22:02:39.409173Z"},"links":{"cited_paper":"/paper/2409.00920","citing_paper":"/paper/2506.22853"},"observation_digest":"sha256:1b882f26ed7c67199aa8ba5c727a2d6a0b01c5d7cac4c0a12248537603a60e92","observation_id":"2f8e3684-0fda-440d-884d-98e4ea610dc6","resolution":{"observed_at":"2026-08-06T22:02:39.409173Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.16634","last_updated":"2023-05-23T22:12:16Z","snapshot_observed_at":"2026-08-02T04:02:36.848064Z","submitted_at":"2023-03-29T12:46:54Z","title":"G-Eval: NLG Evaluation using GPT-4 with Better Human Alignment","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.16634","snapshot_observed_at":"2026-08-06T22:02:39.463112Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.22853","last_updated":"2025-07-02T07:55:09Z","snapshot_observed_at":"2026-08-09T18:57:10.167031Z","submitted_at":"2025-06-28T11:28:04Z","title":"DICE-BENCH: Evaluating the Tool-Use Capabilities of Large Language Models in Multi-Round, Multi-Party Dialogues","version":2},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-06T22:02:39.463112Z"},"links":{"cited_paper":"/paper/2303.16634","citing_paper":"/paper/2506.22853"},"observation_digest":"sha256:e9dc8181e6a193f44183488adc6a81511921452bd3be27208d1bde728893a480","observation_id":"657ffe74-1b1a-4030-b055-d8fcbe58a610","resolution":{"observed_at":"2026-08-06T22:02:39.463112Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:02:44.819510Z","title":"Manning and Hinrich Schütze","venue":null,"work_id":"a365f7d1-4d9e-419d-b445-4236a2e9a407","year":1999},"citing_paper":{"arxiv_id":"2506.22853","last_updated":"2025-07-02T07:55:09Z","snapshot_observed_at":"2026-08-09T18:57:10.167031Z","submitted_at":"2025-06-28T11:28:04Z","title":"DICE-BENCH: Evaluating the Tool-Use Capabilities of Large Language Models in Multi-Round, Multi-Party Dialogues","version":2},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-06T22:02:39.552815Z"},"links":{"citing_paper":"/paper/2506.22853"},"observation_digest":"sha256:de1f655faa994c2733b1e7376e0db12c6822c032e78445f06006b17e14de20bc","observation_id":"5a800961-81c6-4fc3-9866-d9d3e3ff30c3","resolution":{"observed_at":"2026-08-06T22:02:44.883790Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-06T22:02:39.596859Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.22853","last_updated":"2025-07-02T07:55:09Z","snapshot_observed_at":"2026-08-09T18:57:10.167031Z","submitted_at":"2025-06-28T11:28:04Z","title":"DICE-BENCH: Evaluating the Tool-Use Capabilities of Large Language Models in Multi-Round, Multi-Party Dialogues","version":2},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-06T22:02:39.596859Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2506.22853"},"observation_digest":"sha256:be621c80c42a03862743474129d92968630db444d7357b117807a95b9c800a13","observation_id":"f0c6393b-284a-4b21-9170-17b734c0e26e","resolution":{"observed_at":"2026-08-06T22:02:39.596859Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:02:44.648114Z","title":"Bernstein","venue":null,"work_id":"2b8541ca-e7b7-4228-bcc4-14aed782e6c9","year":2023},"citing_paper":{"arxiv_id":"2506.22853","last_updated":"2025-07-02T07:55:09Z","snapshot_observed_at":"2026-08-09T18:57:10.167031Z","submitted_at":"2025-06-28T11:28:04Z","title":"DICE-BENCH: Evaluating the Tool-Use Capabilities of Large Language Models in Multi-Round, Multi-Party Dialogues","version":2},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-06T22:02:39.688152Z"},"links":{"citing_paper":"/paper/2506.22853"},"observation_digest":"sha256:0f20988cc3d1ba8db480a51c496a1271f96c6ee836df29bfc2f136922aa8291e","observation_id":"2eaa2706-e189-4aef-9f14-8d5dd678067d","resolution":{"observed_at":"2026-08-06T22:02:44.719098Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.15334","last_updated":"2023-05-24T16:48:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-05-24T16:48:11Z","title":"Gorilla: Large Language Model Connected with Massive APIs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.15334","snapshot_observed_at":"2026-08-06T22:02:39.734802Z","title":"Patil, Tianjun Zhang, Xin Wang, and Joseph E","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.22853","last_updated":"2025-07-02T07:55:09Z","snapshot_observed_at":"2026-08-09T18:57:10.167031Z","submitted_at":"2025-06-28T11:28:04Z","title":"DICE-BENCH: Evaluating the Tool-Use Capabilities of Large Language Models in Multi-Round, Multi-Party Dialogues","version":2},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-06T22:02:39.734802Z"},"links":{"cited_paper":"/paper/2305.15334","citing_paper":"/paper/2506.22853"},"observation_digest":"sha256:4292f7a08f4642ced4860301119bc082f1d835d15e3412f15a35dc3ab3318f3a","observation_id":"ecc55d3b-2e3a-4235-9a5c-e8ae82c90c84","resolution":{"observed_at":"2026-08-06T22:02:39.734802Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.08354","last_updated":"2024-08-06T15:14:36Z","snapshot_observed_at":"2026-08-08T23:22:13.517141Z","submitted_at":"2023-04-17T15:16:10Z","title":"Tool Learning with Foundation Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.08354","snapshot_observed_at":"2026-08-06T22:02:39.781162Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.22853","last_updated":"2025-07-02T07:55:09Z","snapshot_observed_at":"2026-08-09T18:57:10.167031Z","submitted_at":"2025-06-28T11:28:04Z","title":"DICE-BENCH: Evaluating the Tool-Use Capabilities of Large Language Models in Multi-Round, Multi-Party Dialogues","version":2},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-06T22:02:39.781162Z"},"links":{"cited_paper":"/paper/2304.08354","citing_paper":"/paper/2506.22853"},"observation_digest":"sha256:bd5cbb44a5b5ffec47dba190368a5616a6fa15cb0f28d0190c44101636c77a18","observation_id":"966f52ad-265e-4f2f-9823-e73d8ad708d8","resolution":{"observed_at":"2026-08-06T22:02:39.781162Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.16789","last_updated":"2023-10-03T14:45:48Z","snapshot_observed_at":"2026-07-06T16:00:46.542753Z","submitted_at":"2023-07-31T15:56:53Z","title":"ToolLLM: Facilitating Large Language Models to Master 16000+ Real-world APIs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.16789","snapshot_observed_at":"2026-08-06T22:02:39.832816Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.22853","last_updated":"2025-07-02T07:55:09Z","snapshot_observed_at":"2026-08-09T18:57:10.167031Z","submitted_at":"2025-06-28T11:28:04Z","title":"DICE-BENCH: Evaluating the Tool-Use Capabilities of Large Language Models in Multi-Round, Multi-Party Dialogues","version":2},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-06T22:02:39.832816Z"},"links":{"cited_paper":"/paper/2307.16789","citing_paper":"/paper/2506.22853"},"observation_digest":"sha256:8db6d8c69b7165fa0a07c1bb41a013ad81d7036adafe077a0a5407550b2b830a","observation_id":"d8eefb7e-6129-43c4-9966-2846c830af1d","resolution":{"observed_at":"2026-08-06T22:02:39.832816Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.17935","last_updated":"2024-11-04T15:07:18Z","snapshot_observed_at":"2026-08-09T04:01:18.209494Z","submitted_at":"2024-05-28T08:01:26Z","title":"Tool Learning with Large Language Models: A Survey","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.17935","snapshot_observed_at":"2026-08-06T22:02:39.878785Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.22853","last_updated":"2025-07-02T07:55:09Z","snapshot_observed_at":"2026-08-09T18:57:10.167031Z","submitted_at":"2025-06-28T11:28:04Z","title":"DICE-BENCH: Evaluating the Tool-Use Capabilities of Large Language Models in Multi-Round, Multi-Party Dialogues","version":2},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-06T22:02:39.878785Z"},"links":{"cited_paper":"/paper/2405.17935","citing_paper":"/paper/2506.22853"},"observation_digest":"sha256:239e29604103c76821c683295a7871d6c3c6f2324c0ce11607fd85ce37f66b5a","observation_id":"ebd8a6f6-34b6-4430-8e74-939421a62030","resolution":{"observed_at":"2026-08-06T22:02:39.878785Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15115","snapshot_observed_at":"2026-08-06T22:02:39.913760Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.22853","last_updated":"2025-07-02T07:55:09Z","snapshot_observed_at":"2026-08-09T18:57:10.167031Z","submitted_at":"2025-06-28T11:28:04Z","title":"DICE-BENCH: Evaluating the Tool-Use Capabilities of Large Language Models in Multi-Round, Multi-Party Dialogues","version":2},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-06T22:02:39.913760Z"},"links":{"cited_paper":"/paper/2412.15115","citing_paper":"/paper/2506.22853"},"observation_digest":"sha256:cdbfbb094d4abfd8d523996596289ac653c202d7ce93e0c3a2b32b8f45a8f356","observation_id":"32c161d1-5d57-4b99-b867-84df2740b0c3","resolution":{"observed_at":"2026-08-06T22:02:39.913760Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:02:44.470392Z","title":null,"venue":null,"work_id":"a8030587-32a9-4133-ade5-77a3f0c0892f","year":2023},"citing_paper":{"arxiv_id":"2506.22853","last_updated":"2025-07-02T07:55:09Z","snapshot_observed_at":"2026-08-09T18:57:10.167031Z","submitted_at":"2025-06-28T11:28:04Z","title":"DICE-BENCH: Evaluating the Tool-Use Capabilities of Large Language Models in Multi-Round, Multi-Party Dialogues","version":2},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-06T22:02:39.971592Z"},"links":{"citing_paper":"/paper/2506.22853"},"observation_digest":"sha256:579707d46142e06ec21df31ce8b3c9a62e239b2feff27f761c414cfa48330811","observation_id":"194f2059-bec4-4236-aa48-eaba2aac480e","resolution":{"observed_at":"2026-08-06T22:02:44.547233Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:02:40.010427Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.22853","last_updated":"2025-07-02T07:55:09Z","snapshot_observed_at":"2026-08-09T18:57:10.167031Z","submitted_at":"2025-06-28T11:28:04Z","title":"DICE-BENCH: Evaluating the Tool-Use Capabilities of Large Language Models in Multi-Round, Multi-Party Dialogues","version":2},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-06T22:02:40.010427Z"},"links":{"citing_paper":"/paper/2506.22853"},"observation_digest":"sha256:aad669e14c48e4c2a230cb6c994db61c30bbc0a8b1e2c5179bec07e527fd4d11","observation_id":"5ad492a3-1457-44b2-90e9-cdee7a3a7618","resolution":{"observed_at":"2026-08-06T22:02:40.010427Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.07956","last_updated":"2025-02-11T21:09:24Z","snapshot_observed_at":"2026-08-09T10:07:37.135839Z","submitted_at":"2025-02-11T21:09:24Z","title":"Bridging HCI and AI Research for the Evaluation of Conversational SE Assistants","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.07956","snapshot_observed_at":"2026-08-06T22:02:40.051068Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.22853","last_updated":"2025-07-02T07:55:09Z","snapshot_observed_at":"2026-08-09T18:57:10.167031Z","submitted_at":"2025-06-28T11:28:04Z","title":"DICE-BENCH: Evaluating the Tool-Use Capabilities of Large Language Models in Multi-Round, Multi-Party Dialogues","version":2},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-06T22:02:40.051068Z"},"links":{"cited_paper":"/paper/2502.07956","citing_paper":"/paper/2506.22853"},"observation_digest":"sha256:8c806fe44cca4876e3c01de2fc3158cb3709ff3cd485880b606be69f488e7da6","observation_id":"2fa50049-4b1e-41f4-801b-d5d2a67165f4","resolution":{"observed_at":"2026-08-06T22:02:40.051068Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:02:44.301317Z","title":null,"venue":null,"work_id":"3dd5a575-a785-4f4b-bf3e-0ca4027a864e","year":1988},"citing_paper":{"arxiv_id":"2506.22853","last_updated":"2025-07-02T07:55:09Z","snapshot_observed_at":"2026-08-09T18:57:10.167031Z","submitted_at":"2025-06-28T11:28:04Z","title":"DICE-BENCH: Evaluating the Tool-Use Capabilities of Large Language Models in Multi-Round, Multi-Party Dialogues","version":2},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-06T22:02:40.104042Z"},"links":{"citing_paper":"/paper/2506.22853"},"observation_digest":"sha256:bb6bd504598085f140cdd5bf26fe74d6d2862537bd6704afc5bafb9a7a572b3d","observation_id":"7584eeff-89c0-452b-a71c-7ac4129b577f","resolution":{"observed_at":"2026-08-06T22:02:44.405014Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.04761","last_updated":"2023-02-09T16:49:57Z","snapshot_observed_at":"2026-07-06T14:50:07.491434Z","submitted_at":"2023-02-09T16:49:57Z","title":"Toolformer: Language Models Can Teach Themselves to Use Tools","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.04761","snapshot_observed_at":"2026-08-06T22:02:40.144671Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.22853","last_updated":"2025-07-02T07:55:09Z","snapshot_observed_at":"2026-08-09T18:57:10.167031Z","submitted_at":"2025-06-28T11:28:04Z","title":"DICE-BENCH: Evaluating the Tool-Use Capabilities of Large Language Models in Multi-Round, Multi-Party Dialogues","version":2},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-06T22:02:40.144671Z"},"links":{"cited_paper":"/paper/2302.04761","citing_paper":"/paper/2506.22853"},"observation_digest":"sha256:bcd68c5ca97f42e3da121175fd8bc190c37b7c2151c00e49f8bc2049161c3501","observation_id":"ddb17d27-535d-41e0-9462-2883dd5cd10f","resolution":{"observed_at":"2026-08-06T22:02:40.144671Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:02:44.158667Z","title":null,"venue":null,"work_id":"4f9a880b-0012-465e-8caf-b77d17fc4d51","year":2024},"citing_paper":{"arxiv_id":"2506.22853","last_updated":"2025-07-02T07:55:09Z","snapshot_observed_at":"2026-08-09T18:57:10.167031Z","submitted_at":"2025-06-28T11:28:04Z","title":"DICE-BENCH: Evaluating the Tool-Use Capabilities of Large Language Models in Multi-Round, Multi-Party Dialogues","version":2},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-06T22:02:40.206383Z"},"links":{"citing_paper":"/paper/2506.22853"},"observation_digest":"sha256:866ebe994ad3a86f9d4d88ae232c8b8d60ee7544e83522571bac7d3ca984b419","observation_id":"598b52fb-ac15-4bd5-a9b2-6d0320e92621","resolution":{"observed_at":"2026-08-06T22:02:44.220824Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.18760","last_updated":"2024-11-01T14:37:37Z","snapshot_observed_at":"2026-07-06T16:55:09.267685Z","submitted_at":"2023-11-30T18:02:44Z","title":"TaskBench: Benchmarking Large Language Models for Task Automation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.18760","snapshot_observed_at":"2026-08-06T22:02:40.257193Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.22853","last_updated":"2025-07-02T07:55:09Z","snapshot_observed_at":"2026-08-09T18:57:10.167031Z","submitted_at":"2025-06-28T11:28:04Z","title":"DICE-BENCH: Evaluating the Tool-Use Capabilities of Large Language Models in Multi-Round, Multi-Party Dialogues","version":2},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-06T22:02:40.257193Z"},"links":{"cited_paper":"/paper/2311.18760","citing_paper":"/paper/2506.22853"},"observation_digest":"sha256:0e3ab594035ce99b33e82f911363684b8ab9415be7e70d5c751c6f2be8a45a51","observation_id":"ab839f1b-689b-47f7-a359-3fff8177c7b7","resolution":{"observed_at":"2026-08-06T22:02:40.257193Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.05301","last_updated":"2023-09-07T12:20:45Z","snapshot_observed_at":"2026-07-06T15:40:20.267344Z","submitted_at":"2023-06-08T15:46:32Z","title":"ToolAlpaca: Generalized Tool Learning for Language Models with 3000 Simulated Cases","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.05301","snapshot_observed_at":"2026-08-06T22:02:40.291583Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.22853","last_updated":"2025-07-02T07:55:09Z","snapshot_observed_at":"2026-08-09T18:57:10.167031Z","submitted_at":"2025-06-28T11:28:04Z","title":"DICE-BENCH: Evaluating the Tool-Use Capabilities of Large Language Models in Multi-Round, Multi-Party Dialogues","version":2},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-06T22:02:40.291583Z"},"links":{"cited_paper":"/paper/2306.05301","citing_paper":"/paper/2506.22853"},"observation_digest":"sha256:d60d2b7f73dd99227536f1d0a573822331865b74b17ff1d63aa2c5fd3d1d86e9","observation_id":"da63ca7c-fa85-4fa8-903e-c1c44a098e9e","resolution":{"observed_at":"2026-08-06T22:02:40.291583Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.14165","last_updated":"2020-07-22T19:47:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-05-28T17:29:03Z","title":"Language Models are Few-Shot Learners","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.14165","snapshot_observed_at":"2026-08-06T22:02:40.342829Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.22853","last_updated":"2025-07-02T07:55:09Z","snapshot_observed_at":"2026-08-09T18:57:10.167031Z","submitted_at":"2025-06-28T11:28:04Z","title":"DICE-BENCH: Evaluating the Tool-Use Capabilities of Large Language Models in Multi-Round, Multi-Party Dialogues","version":2},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-06T22:02:40.342829Z"},"links":{"cited_paper":"/paper/2005.14165","citing_paper":"/paper/2506.22853"},"observation_digest":"sha256:6f3a9fd0bbcddc0b50a4640e4b8ab01f3d01073177edca0f213908e45eecad95","observation_id":"4c1a3027-16e2-4f09-8e63-345342b65479","resolution":{"observed_at":"2026-08-06T22:02:40.342829Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:02:43.968243Z","title":null,"venue":null,"work_id":"596ace5e-5357-4754-ae26-d3a2e6ead742","year":2023},"citing_paper":{"arxiv_id":"2506.22853","last_updated":"2025-07-02T07:55:09Z","snapshot_observed_at":"2026-08-09T18:57:10.167031Z","submitted_at":"2025-06-28T11:28:04Z","title":"DICE-BENCH: Evaluating the Tool-Use Capabilities of Large Language Models in Multi-Round, Multi-Party Dialogues","version":2},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-06T22:02:40.389822Z"},"links":{"citing_paper":"/paper/2506.22853"},"observation_digest":"sha256:6af8144c5b4780ca68764692cb1f14f577b97daf5c6fc1d869a20cb164789ada","observation_id":"bfc23798-d9ac-4d89-8eed-a0dc20e9b9e5","resolution":{"observed_at":"2026-08-06T22:02:44.037471Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-06T22:02:40.421187Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.22853","last_updated":"2025-07-02T07:55:09Z","snapshot_observed_at":"2026-08-09T18:57:10.167031Z","submitted_at":"2025-06-28T11:28:04Z","title":"DICE-BENCH: Evaluating the Tool-Use Capabilities of Large Language Models in Multi-Round, Multi-Party Dialogues","version":2},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-06T22:02:40.421187Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2506.22853"},"observation_digest":"sha256:a0da69f5cf68d62a53b457f53864596f783e5deef5dc097490651823c154c874","observation_id":"0c97b5fb-b823-42e4-a498-5d6d718bb907","resolution":{"observed_at":"2026-08-06T22:02:40.421187Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.14268","last_updated":"2024-08-14T00:48:43Z","snapshot_observed_at":"2026-08-07T10:54:15.798591Z","submitted_at":"2024-01-25T16:02:56Z","title":"GPTVoiceTasker: Advancing Multi-step Mobile Task Efficiency Through Dynamic Interface Exploration and Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.14268","snapshot_observed_at":"2026-08-06T22:02:40.459154Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.22853","last_updated":"2025-07-02T07:55:09Z","snapshot_observed_at":"2026-08-09T18:57:10.167031Z","submitted_at":"2025-06-28T11:28:04Z","title":"DICE-BENCH: Evaluating the Tool-Use Capabilities of Large Language Models in Multi-Round, Multi-Party Dialogues","version":2},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-06T22:02:40.459154Z"},"links":{"cited_paper":"/paper/2401.14268","citing_paper":"/paper/2506.22853"},"observation_digest":"sha256:64e624deaa545f997f0ff1232e2e4aac44d364b89b0e6a87c4e8c8ea37b7568e","observation_id":"56f80d99-8a0d-437b-bc30-9babfb099cdb","resolution":{"observed_at":"2026-08-06T22:02:40.459154Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:02:43.808989Z","title":null,"venue":null,"work_id":"9a078d25-cddf-4bf8-ab5b-52054db3601f","year":2010},"citing_paper":{"arxiv_id":"2506.22853","last_updated":"2025-07-02T07:55:09Z","snapshot_observed_at":"2026-08-09T18:57:10.167031Z","submitted_at":"2025-06-28T11:28:04Z","title":"DICE-BENCH: Evaluating the Tool-Use Capabilities of Large Language Models in Multi-Round, Multi-Party Dialogues","version":2},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-06T22:02:40.521310Z"},"links":{"citing_paper":"/paper/2506.22853"},"observation_digest":"sha256:312470aacf5a9bd00bbaf301b4d611f682fe965057980507665a189a82cfe35a","observation_id":"65dc56bb-2c0b-442d-b3db-66e711f76d3d","resolution":{"observed_at":"2026-08-06T22:02:43.889198Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:02:43.656194Z","title":null,"venue":null,"work_id":"b47cc76b-2c23-4f6b-a00d-3130e5e1b2ca","year":1995},"citing_paper":{"arxiv_id":"2506.22853","last_updated":"2025-07-02T07:55:09Z","snapshot_observed_at":"2026-08-09T18:57:10.167031Z","submitted_at":"2025-06-28T11:28:04Z","title":"DICE-BENCH: Evaluating the Tool-Use Capabilities of Large Language Models in Multi-Round, Multi-Party Dialogues","version":2},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-06T22:02:40.565257Z"},"links":{"citing_paper":"/paper/2506.22853"},"observation_digest":"sha256:59187eab4438ad2e4bb1a78dc63e2eba13604bfc45fe148000a659575167c164","observation_id":"f8e6265f-9550-45e8-9f25-2c6b399afcd5","resolution":{"observed_at":"2026-08-06T22:02:43.705152Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:02:40.606739Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.22853","last_updated":"2025-07-02T07:55:09Z","snapshot_observed_at":"2026-08-09T18:57:10.167031Z","submitted_at":"2025-06-28T11:28:04Z","title":"DICE-BENCH: Evaluating the Tool-Use Capabilities of Large Language Models in Multi-Round, Multi-Party Dialogues","version":2},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-06T22:02:40.606739Z"},"links":{"citing_paper":"/paper/2506.22853"},"observation_digest":"sha256:8390faeb7e74f7be206778efb85f26ae621aafe794173769fd30304c0cae5619","observation_id":"5909157e-e86c-44ea-9604-ca43eb156c05","resolution":{"observed_at":"2026-08-06T22:02:40.606739Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.11710","last_updated":"2024-10-15T15:46:17Z","snapshot_observed_at":"2026-07-06T19:33:57.090585Z","submitted_at":"2024-10-15T15:46:17Z","title":"MTU-Bench: A Multi-granularity Tool-Use Benchmark for Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.11710","snapshot_observed_at":"2026-08-06T22:02:40.651835Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.22853","last_updated":"2025-07-02T07:55:09Z","snapshot_observed_at":"2026-08-09T18:57:10.167031Z","submitted_at":"2025-06-28T11:28:04Z","title":"DICE-BENCH: Evaluating the Tool-Use Capabilities of Large Language Models in Multi-Round, Multi-Party Dialogues","version":2},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-06T22:02:40.651835Z"},"links":{"cited_paper":"/paper/2410.11710","citing_paper":"/paper/2506.22853"},"observation_digest":"sha256:3aaf9a7ac4cf5c68d29c053a5a34ab65f54876bbe0c030f162a753ea7c201440","observation_id":"223e56c2-0253-48b2-8fd1-41e74a31a625","resolution":{"observed_at":"2026-08-06T22:02:40.651835Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:02:43.518473Z","title":null,"venue":null,"work_id":"4c614866-e577-4d1d-a4b4-94a724bb4d2a","year":1966},"citing_paper":{"arxiv_id":"2506.22853","last_updated":"2025-07-02T07:55:09Z","snapshot_observed_at":"2026-08-09T18:57:10.167031Z","submitted_at":"2025-06-28T11:28:04Z","title":"DICE-BENCH: Evaluating the Tool-Use Capabilities of Large Language Models in Multi-Round, Multi-Party Dialogues","version":2},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-06T22:02:40.699899Z"},"links":{"citing_paper":"/paper/2506.22853"},"observation_digest":"sha256:b3d7d81fbd1f0ab997ec496b3b0ba154895d9a57b640db4aa27c24aef55dbf92","observation_id":"97428b19-a228-4f2d-af5d-9c1cf2c353fc","resolution":{"observed_at":"2026-08-06T22:02:43.580860Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.16504","last_updated":"2023-05-25T22:10:20Z","snapshot_observed_at":"2026-08-06T09:13:52.781559Z","submitted_at":"2023-05-25T22:10:20Z","title":"On the Tool Manipulation Capability of Open-source Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.16504","snapshot_observed_at":"2026-08-06T22:02:40.749933Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.22853","last_updated":"2025-07-02T07:55:09Z","snapshot_observed_at":"2026-08-09T18:57:10.167031Z","submitted_at":"2025-06-28T11:28:04Z","title":"DICE-BENCH: Evaluating the Tool-Use Capabilities of Large Language Models in Multi-Round, Multi-Party Dialogues","version":2},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-06T22:02:40.749933Z"},"links":{"cited_paper":"/paper/2305.16504","citing_paper":"/paper/2506.22853"},"observation_digest":"sha256:5fae516c7ace699f888a33b02b95425d5fd45d0eb9bf0363fa1881d6603704ab","observation_id":"5321c14a-8d40-4db5-a641-3352980a350c","resolution":{"observed_at":"2026-08-06T22:02:40.749933Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.00741","last_updated":"2024-12-05T07:05:59Z","snapshot_observed_at":"2026-08-10T06:21:45.210475Z","submitted_at":"2024-01-01T12:49:36Z","title":"ToolEyes: Fine-Grained Evaluation for Tool Learning Capabilities of Large Language Models in Real-world Scenarios","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.00741","snapshot_observed_at":"2026-08-06T22:02:40.814433Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.22853","last_updated":"2025-07-02T07:55:09Z","snapshot_observed_at":"2026-08-09T18:57:10.167031Z","submitted_at":"2025-06-28T11:28:04Z","title":"DICE-BENCH: Evaluating the Tool-Use Capabilities of Large Language Models in Multi-Round, Multi-Party Dialogues","version":2},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-06T22:02:40.814433Z"},"links":{"cited_paper":"/paper/2401.00741","citing_paper":"/paper/2506.22853"},"observation_digest":"sha256:d8df0ae85737a8109d9922df7a8d72696a20b2c48674116bcb45f08b48d40d7a","observation_id":"aa42965a-feaf-4205-9eb2-6acc7788c794","resolution":{"observed_at":"2026-08-06T22:02:40.814433Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.08326","last_updated":"2024-09-21T08:03:33Z","snapshot_observed_at":"2026-08-10T11:01:43.661299Z","submitted_at":"2024-01-16T12:45:15Z","title":"RoTBench: A Multi-Level Benchmark for Evaluating the Robustness of Large Language Models in Tool Learning","version":3},"cited_work":{"arxiv_id":"2401.08326","doi":null,"metadata_source":"pith","pith_arxiv_id":"2401.08326","snapshot_observed_at":"2026-08-06T22:02:41.257812Z","title":"RoTBench: A Multi-Level Benchmark for Evaluating the Robustness of Large Language Models in Tool Learning","venue":"cs.CL","work_id":"62304fb1-3a11-4d2b-a49d-dd4918453a65","year":2024},"citing_paper":{"arxiv_id":"2506.22853","last_updated":"2025-07-02T07:55:09Z","snapshot_observed_at":"2026-08-09T18:57:10.167031Z","submitted_at":"2025-06-28T11:28:04Z","title":"DICE-BENCH: Evaluating the Tool-Use Capabilities of Large Language Models in Multi-Round, Multi-Party Dialogues","version":2},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-06T22:02:40.848146Z"},"links":{"cited_paper":"/paper/2401.08326","citing_paper":"/paper/2506.22853"},"observation_digest":"sha256:4db05f3e9cd5be2938b0608a71a5ba2da91e4b96b2ae0503327dcc1d5a230ecf","observation_id":"14228d02-f6a2-4b96-bd90-60acba2b90c2","resolution":{"observed_at":"2026-08-06T22:02:41.368776Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:02:43.341667Z","title":"Schweitzer, and Alison Wood Brooks","venue":null,"work_id":"c14f6f74-c0b4-48ca-871f-a9be491eb437","year":2022},"citing_paper":{"arxiv_id":"2506.22853","last_updated":"2025-07-02T07:55:09Z","snapshot_observed_at":"2026-08-09T18:57:10.167031Z","submitted_at":"2025-06-28T11:28:04Z","title":"DICE-BENCH: Evaluating the Tool-Use Capabilities of Large Language Models in Multi-Round, Multi-Party Dialogues","version":2},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-06T22:02:40.893204Z"},"links":{"citing_paper":"/paper/2506.22853"},"observation_digest":"sha256:7230a3dbc9b45110c9765f9c1da2f25beb267bbba2e185159eb43521ab5bd68e","observation_id":"23c8b628-30fe-47e5-a5ad-8bcf7a1084c4","resolution":{"observed_at":"2026-08-06T22:02:43.458492Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.09959","last_updated":"2025-01-17T05:21:49Z","snapshot_observed_at":"2026-08-10T19:27:34.306445Z","submitted_at":"2025-01-17T05:21:49Z","title":"A Survey on Multi-Turn Interaction Capabilities of Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.09959","snapshot_observed_at":"2026-08-06T22:02:40.944596Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.22853","last_updated":"2025-07-02T07:55:09Z","snapshot_observed_at":"2026-08-09T18:57:10.167031Z","submitted_at":"2025-06-28T11:28:04Z","title":"DICE-BENCH: Evaluating the Tool-Use Capabilities of Large Language Models in Multi-Round, Multi-Party Dialogues","version":2},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-06T22:02:40.944596Z"},"links":{"cited_paper":"/paper/2501.09959","citing_paper":"/paper/2506.22853"},"observation_digest":"sha256:99730d0df525408fffa868742112f324562bba717ccea823538241795db3df12","observation_id":"381dc53e-59e5-4fd9-b493-50ebe7b64b8d","resolution":{"observed_at":"2026-08-06T22:02:40.944596Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.13304","last_updated":"2023-06-23T05:43:28Z","snapshot_observed_at":"2026-08-09T04:08:10.447500Z","submitted_at":"2023-06-23T05:43:28Z","title":"ToolQA: A Dataset for LLM Question Answering with External Tools","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.13304","snapshot_observed_at":"2026-08-06T22:02:40.986835Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.22853","last_updated":"2025-07-02T07:55:09Z","snapshot_observed_at":"2026-08-09T18:57:10.167031Z","submitted_at":"2025-06-28T11:28:04Z","title":"DICE-BENCH: Evaluating the Tool-Use Capabilities of Large Language Models in Multi-Round, Multi-Party Dialogues","version":2},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-06T22:02:40.986835Z"},"links":{"cited_paper":"/paper/2306.13304","citing_paper":"/paper/2506.22853"},"observation_digest":"sha256:01b98df0d6e68740894ae1cde029c768ee10d87b9e83c0b5e240640189956438","observation_id":"3e5d6cd4-2439-4fcc-9d6c-a6c20b2f61bf","resolution":{"observed_at":"2026-08-06T22:02:40.986835Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:02:41.035264Z","title":"online\" 'onlinestring :=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.22853","last_updated":"2025-07-02T07:55:09Z","snapshot_observed_at":"2026-08-09T18:57:10.167031Z","submitted_at":"2025-06-28T11:28:04Z","title":"DICE-BENCH: Evaluating the Tool-Use Capabilities of Large Language Models in Multi-Round, Multi-Party Dialogues","version":2},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-06T22:02:41.035264Z"},"links":{"citing_paper":"/paper/2506.22853"},"observation_digest":"sha256:a602a942a7f12097ae186ef8ff5a6ffa573eb7a3627ecc7348a3bb14742af20e","observation_id":"e7d363ed-31e3-499e-9178-35297422add4","resolution":{"observed_at":"2026-08-06T22:02:41.035264Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:02:41.100115Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.22853","last_updated":"2025-07-02T07:55:09Z","snapshot_observed_at":"2026-08-09T18:57:10.167031Z","submitted_at":"2025-06-28T11:28:04Z","title":"DICE-BENCH: Evaluating the Tool-Use Capabilities of Large Language Models in Multi-Round, Multi-Party Dialogues","version":2},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-06T22:02:41.100115Z"},"links":{"citing_paper":"/paper/2506.22853"},"observation_digest":"sha256:e7811788b423587fc357fb9aa71ae612327790f356455550743fefec7dd95bec","observation_id":"6c7cba1e-c6ed-4806-8dfb-91e3dfc4747b","resolution":{"observed_at":"2026-08-06T22:02:41.100115Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2506.22853","last_updated":"2025-07-02T07:55:09Z","latest_version":2,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-09T18:57:10.167031Z","submitted_at":"2025-06-28T11:28:04Z","title":"DICE-BENCH: Evaluating the Tool-Use Capabilities of Large Language Models in Multi-Round, Multi-Party Dialogues"},"reference_resolution":{"displayed":56,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":48,"verified_exact":5,"verified_fuzzy":3},"total_outbound_references":56},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 56 of 56 outbound references and 0 inbound Pith citation observations for arXiv:2506.22853."}