{"as_of":"2026-08-10T06:17:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:0a28b44a4e729ba19ae475c3fd5e61b05855a9f9eb947981dab9c4cc6af68ed1","coverage":[{"denominator":53,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":53,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-02T07:36:55.011277Z","state":"measured"},{"denominator":53,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":53,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.20536/citation-record","integrity":"/paper/2607.20536/integrity","json":"/paper/2607.20536/citation-record.json","paper":"/paper/2607.20536"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:36:48.517359Z","title":"Langley , title =","venue":null,"work_id":null,"year":2000},"citing_paper":{"arxiv_id":"2607.20536","last_updated":"2026-07-10T16:55:04Z","snapshot_observed_at":"2026-08-08T12:24:06.472564Z","submitted_at":"2026-07-10T16:55:04Z","title":"AppWorld-UL: Benchmarking Diverse Agent-User Interactions for Tool-Use","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-02T07:36:48.517359Z"},"links":{"citing_paper":"/paper/2607.20536"},"observation_digest":"sha256:88b6dc4b31f191feb526cbad4b7e262c74c702e2d333b1ac96670123ea4737ee","observation_id":"3efdc218-144f-43b2-ba01-4e55c7ce3709","resolution":{"observed_at":"2026-08-02T07:36:48.517359Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:36:48.605709Z","title":null,"venue":null,"work_id":null,"year":1980},"citing_paper":{"arxiv_id":"2607.20536","last_updated":"2026-07-10T16:55:04Z","snapshot_observed_at":"2026-08-08T12:24:06.472564Z","submitted_at":"2026-07-10T16:55:04Z","title":"AppWorld-UL: Benchmarking Diverse Agent-User Interactions for Tool-Use","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-02T07:36:48.605709Z"},"links":{"citing_paper":"/paper/2607.20536"},"observation_digest":"sha256:de8cef907a160dcec37d84e071c33fe7f68c81fe1fa2b2888aa3e8808018daf6","observation_id":"355bbb3d-7073-484b-af03-75ab73c50eb5","resolution":{"observed_at":"2026-08-02T07:36:48.605709Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:36:48.634436Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.20536","last_updated":"2026-07-10T16:55:04Z","snapshot_observed_at":"2026-08-08T12:24:06.472564Z","submitted_at":"2026-07-10T16:55:04Z","title":"AppWorld-UL: Benchmarking Diverse Agent-User Interactions for Tool-Use","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-02T07:36:48.634436Z"},"links":{"citing_paper":"/paper/2607.20536"},"observation_digest":"sha256:36f735c9d082fa4d0495dd0c75d30c95bcc9cd8083a9052be20ec47e47dae787","observation_id":"dc5cf1a2-6680-46bf-9ff4-1a15caecd495","resolution":{"observed_at":"2026-08-02T07:36:48.634436Z","resolver_source":null,"status":"parse_uncertain"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:36:48.694273Z","title":null,"venue":null,"work_id":null,"year":1983},"citing_paper":{"arxiv_id":"2607.20536","last_updated":"2026-07-10T16:55:04Z","snapshot_observed_at":"2026-08-08T12:24:06.472564Z","submitted_at":"2026-07-10T16:55:04Z","title":"AppWorld-UL: Benchmarking Diverse Agent-User Interactions for Tool-Use","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-02T07:36:48.694273Z"},"links":{"citing_paper":"/paper/2607.20536"},"observation_digest":"sha256:298e1979b6475241f8a4071cc48e51717362ee0b38c3e869a9b6d25918653d24","observation_id":"7f2a4149-83eb-4d77-ad36-b788b30c8ace","resolution":{"observed_at":"2026-08-02T07:36:48.694273Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:36:48.741398Z","title":null,"venue":null,"work_id":null,"year":2000},"citing_paper":{"arxiv_id":"2607.20536","last_updated":"2026-07-10T16:55:04Z","snapshot_observed_at":"2026-08-08T12:24:06.472564Z","submitted_at":"2026-07-10T16:55:04Z","title":"AppWorld-UL: Benchmarking Diverse Agent-User Interactions for Tool-Use","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-02T07:36:48.741398Z"},"links":{"citing_paper":"/paper/2607.20536"},"observation_digest":"sha256:3388b38b6907ece2bc7f03c0f118ff83a256c041b192b80f8ee406e2d8f4ede9","observation_id":"25c2e528-2380-4563-8ddd-e0d240e0429a","resolution":{"observed_at":"2026-08-02T07:36:48.741398Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:36:48.817404Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.20536","last_updated":"2026-07-10T16:55:04Z","snapshot_observed_at":"2026-08-08T12:24:06.472564Z","submitted_at":"2026-07-10T16:55:04Z","title":"AppWorld-UL: Benchmarking Diverse Agent-User Interactions for Tool-Use","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-02T07:36:48.817404Z"},"links":{"citing_paper":"/paper/2607.20536"},"observation_digest":"sha256:31596d99d46a08976825d4ac7e56e385905e1fbb0ae7b0903bdf48de918a5e68","observation_id":"bae41c90-021b-4728-95ee-f1abc39d013e","resolution":{"observed_at":"2026-08-02T07:36:48.817404Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:36:48.876018Z","title":"Newell and P","venue":null,"work_id":null,"year":1981},"citing_paper":{"arxiv_id":"2607.20536","last_updated":"2026-07-10T16:55:04Z","snapshot_observed_at":"2026-08-08T12:24:06.472564Z","submitted_at":"2026-07-10T16:55:04Z","title":"AppWorld-UL: Benchmarking Diverse Agent-User Interactions for Tool-Use","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-02T07:36:48.876018Z"},"links":{"citing_paper":"/paper/2607.20536"},"observation_digest":"sha256:f2d645d047f688fb27aa45689ddef6d1602f73ddfc07e49fae4a5c63154a8943","observation_id":"c82c9d0a-f448-488e-b566-3af110b3bbe1","resolution":{"observed_at":"2026-08-02T07:36:48.876018Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:36:48.923054Z","title":null,"venue":null,"work_id":null,"year":1959},"citing_paper":{"arxiv_id":"2607.20536","last_updated":"2026-07-10T16:55:04Z","snapshot_observed_at":"2026-08-08T12:24:06.472564Z","submitted_at":"2026-07-10T16:55:04Z","title":"AppWorld-UL: Benchmarking Diverse Agent-User Interactions for Tool-Use","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-02T07:36:48.923054Z"},"links":{"citing_paper":"/paper/2607.20536"},"observation_digest":"sha256:459ef17fda1c838d31080b080a934544c16f82c263feb6e962217ca94aaec813","observation_id":"eba2cbe9-97d7-4162-965e-9a616d65274b","resolution":{"observed_at":"2026-08-02T07:36:48.923054Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:36:48.977758Z","title":"2024 , url =","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.20536","last_updated":"2026-07-10T16:55:04Z","snapshot_observed_at":"2026-08-08T12:24:06.472564Z","submitted_at":"2026-07-10T16:55:04Z","title":"AppWorld-UL: Benchmarking Diverse Agent-User Interactions for Tool-Use","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-02T07:36:48.977758Z"},"links":{"citing_paper":"/paper/2607.20536"},"observation_digest":"sha256:27ffc5d747cb0ac6f2552b284201b3b670310d3208c668ad36467c3a6403b222","observation_id":"25b05138-094b-4d68-998d-44a7c7c5991e","resolution":{"observed_at":"2026-08-02T07:36:48.977758Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:36:49.058278Z","title":"2024 , isbn =","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.20536","last_updated":"2026-07-10T16:55:04Z","snapshot_observed_at":"2026-08-08T12:24:06.472564Z","submitted_at":"2026-07-10T16:55:04Z","title":"AppWorld-UL: Benchmarking Diverse Agent-User Interactions for Tool-Use","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-02T07:36:49.058278Z"},"links":{"citing_paper":"/paper/2607.20536"},"observation_digest":"sha256:e43bd9884ed884fb9de9fd799e3c9ef44aa4bd28a11ac4ed181384db0dbbfd58","observation_id":"664c8055-9fe9-40d7-8fdb-5aab052b677d","resolution":{"observed_at":"2026-08-02T07:36:49.058278Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:36:49.141251Z","title":"2025 , isbn =","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.20536","last_updated":"2026-07-10T16:55:04Z","snapshot_observed_at":"2026-08-08T12:24:06.472564Z","submitted_at":"2026-07-10T16:55:04Z","title":"AppWorld-UL: Benchmarking Diverse Agent-User Interactions for Tool-Use","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-02T07:36:49.141251Z"},"links":{"citing_paper":"/paper/2607.20536"},"observation_digest":"sha256:86d8095b46c19e7dffa6e03a82a0d71ed8ebdf35c46ff7092767f8df48d2928c","observation_id":"43f210db-2852-4caf-bdf5-edf85a0396c1","resolution":{"observed_at":"2026-08-02T07:36:49.141251Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:36:49.271218Z","title":"2025 , url =","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.20536","last_updated":"2026-07-10T16:55:04Z","snapshot_observed_at":"2026-08-08T12:24:06.472564Z","submitted_at":"2026-07-10T16:55:04Z","title":"AppWorld-UL: Benchmarking Diverse Agent-User Interactions for Tool-Use","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-02T07:36:49.271218Z"},"links":{"citing_paper":"/paper/2607.20536"},"observation_digest":"sha256:b0cf208118e0d6173dd2cfcfc6f278953776de07cbfca4216fc21883f8d1be15","observation_id":"f577f408-5ec9-488e-a1cf-9d4379cdc1ac","resolution":{"observed_at":"2026-08-02T07:36:49.271218Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:36:49.337147Z","title":"2024 , isbn =","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.20536","last_updated":"2026-07-10T16:55:04Z","snapshot_observed_at":"2026-08-08T12:24:06.472564Z","submitted_at":"2026-07-10T16:55:04Z","title":"AppWorld-UL: Benchmarking Diverse Agent-User Interactions for Tool-Use","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-02T07:36:49.337147Z"},"links":{"citing_paper":"/paper/2607.20536"},"observation_digest":"sha256:60c57c0172ad611abfc8635428b68ded15b0edb50ade93e348cd17a6638a0cd2","observation_id":"adc1bba3-b1ea-4b01-bb01-b045f99345be","resolution":{"observed_at":"2026-08-02T07:36:49.337147Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:36:49.364486Z","title":"2024 , isbn =","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.20536","last_updated":"2026-07-10T16:55:04Z","snapshot_observed_at":"2026-08-08T12:24:06.472564Z","submitted_at":"2026-07-10T16:55:04Z","title":"AppWorld-UL: Benchmarking Diverse Agent-User Interactions for Tool-Use","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-02T07:36:49.364486Z"},"links":{"citing_paper":"/paper/2607.20536"},"observation_digest":"sha256:3e5eb2c36897c82f2a34519b806b9a73bdd3d31f5bf2dae8ab847531a9a197e2","observation_id":"c6759381-b1c2-43fa-8a4a-9b8242fc280d","resolution":{"observed_at":"2026-08-02T07:36:49.364486Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:36:49.424814Z","title":"2022 , url =","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.20536","last_updated":"2026-07-10T16:55:04Z","snapshot_observed_at":"2026-08-08T12:24:06.472564Z","submitted_at":"2026-07-10T16:55:04Z","title":"AppWorld-UL: Benchmarking Diverse Agent-User Interactions for Tool-Use","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-02T07:36:49.424814Z"},"links":{"citing_paper":"/paper/2607.20536"},"observation_digest":"sha256:78be5bd61111bd3fdc186e9da3201cc3e22a8d5a89ca258e8b609ac8529cc424","observation_id":"9e7bb591-3ae0-42a8-b2f1-ebe31359cb5a","resolution":{"observed_at":"2026-08-02T07:36:49.424814Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:36:49.471506Z","title":"2024 , eprint=","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.20536","last_updated":"2026-07-10T16:55:04Z","snapshot_observed_at":"2026-08-08T12:24:06.472564Z","submitted_at":"2026-07-10T16:55:04Z","title":"AppWorld-UL: Benchmarking Diverse Agent-User Interactions for Tool-Use","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-02T07:36:49.471506Z"},"links":{"citing_paper":"/paper/2607.20536"},"observation_digest":"sha256:7ed4c07603c3e74d516aaa377b1ea1eccefed4ea2332b974172cf6f5bf0a78ff","observation_id":"7da16753-11d9-4d8e-8a02-adf703b82c3b","resolution":{"observed_at":"2026-08-02T07:36:49.471506Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:36:49.571420Z","title":"2025 , eprint=","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.20536","last_updated":"2026-07-10T16:55:04Z","snapshot_observed_at":"2026-08-08T12:24:06.472564Z","submitted_at":"2026-07-10T16:55:04Z","title":"AppWorld-UL: Benchmarking Diverse Agent-User Interactions for Tool-Use","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-02T07:36:49.571420Z"},"links":{"citing_paper":"/paper/2607.20536"},"observation_digest":"sha256:7b4da278db27642231b517f290309cadbd90c085a9dc531ef5a045098e794a4d","observation_id":"21272786-2ef8-495c-9cdc-8b75605bb01a","resolution":{"observed_at":"2026-08-02T07:36:49.571420Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:36:49.935559Z","title":"Gonzalez and Shishir G","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.20536","last_updated":"2026-07-10T16:55:04Z","snapshot_observed_at":"2026-08-08T12:24:06.472564Z","submitted_at":"2026-07-10T16:55:04Z","title":"AppWorld-UL: Benchmarking Diverse Agent-User Interactions for Tool-Use","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-02T07:36:49.935559Z"},"links":{"citing_paper":"/paper/2607.20536"},"observation_digest":"sha256:e296ad5bb041bc03c0ccc2a67f0d21fb0f63a68571c495cc4773399649ab6f0a","observation_id":"d57b60cb-4dc5-4e72-9846-613f7002a283","resolution":{"observed_at":"2026-08-02T07:36:49.935559Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:36:50.184758Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.20536","last_updated":"2026-07-10T16:55:04Z","snapshot_observed_at":"2026-08-08T12:24:06.472564Z","submitted_at":"2026-07-10T16:55:04Z","title":"AppWorld-UL: Benchmarking Diverse Agent-User Interactions for Tool-Use","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-02T07:36:50.184758Z"},"links":{"citing_paper":"/paper/2607.20536"},"observation_digest":"sha256:dbf79548f00bbe84f320eb1e4eb78f33fef5e4aeadb5b9337606169684921f31","observation_id":"7b092c73-b9e1-4e53-aec5-a37749550c28","resolution":{"observed_at":"2026-08-02T07:36:50.184758Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:36:50.264753Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.20536","last_updated":"2026-07-10T16:55:04Z","snapshot_observed_at":"2026-08-08T12:24:06.472564Z","submitted_at":"2026-07-10T16:55:04Z","title":"AppWorld-UL: Benchmarking Diverse Agent-User Interactions for Tool-Use","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-02T07:36:50.264753Z"},"links":{"citing_paper":"/paper/2607.20536"},"observation_digest":"sha256:f163491b0e5105f96c55840af3368ac127bfbdfeef4787c0e17f1b0b7a94898b","observation_id":"46de64ed-59fc-487e-8bc9-146f530275b4","resolution":{"observed_at":"2026-08-02T07:36:50.264753Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:36:50.365423Z","title":"Xu and Hao Zhu and Xuhui Zhou and Robert Lo and Abishek Sridhar and Xianyi Cheng and Tianyue Ou and Yonatan Bisk and Daniel Fried and Uri Alon and Graham Neubig , booktitle=","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.20536","last_updated":"2026-07-10T16:55:04Z","snapshot_observed_at":"2026-08-08T12:24:06.472564Z","submitted_at":"2026-07-10T16:55:04Z","title":"AppWorld-UL: Benchmarking Diverse Agent-User Interactions for Tool-Use","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-02T07:36:50.365423Z"},"links":{"citing_paper":"/paper/2607.20536"},"observation_digest":"sha256:0fc646bf14c926a33c838a5006a159f3591ba1242af8032fc719d4906f7b3cbc","observation_id":"851dd3a4-0445-4173-a0f6-ec61a7832dae","resolution":{"observed_at":"2026-08-02T07:36:50.365423Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:36:50.484836Z","title":"2024 , url=","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.20536","last_updated":"2026-07-10T16:55:04Z","snapshot_observed_at":"2026-08-08T12:24:06.472564Z","submitted_at":"2026-07-10T16:55:04Z","title":"AppWorld-UL: Benchmarking Diverse Agent-User Interactions for Tool-Use","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-02T07:36:50.484836Z"},"links":{"citing_paper":"/paper/2607.20536"},"observation_digest":"sha256:30ead76a102915603510a8d49eadbb9351681a1242b3a7faec836de3c08db093","observation_id":"9cddcedc-0ace-42db-babf-d703c535007b","resolution":{"observed_at":"2026-08-02T07:36:50.484836Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:36:50.585263Z","title":"Introducing","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.20536","last_updated":"2026-07-10T16:55:04Z","snapshot_observed_at":"2026-08-08T12:24:06.472564Z","submitted_at":"2026-07-10T16:55:04Z","title":"AppWorld-UL: Benchmarking Diverse Agent-User Interactions for Tool-Use","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-02T07:36:50.585263Z"},"links":{"citing_paper":"/paper/2607.20536"},"observation_digest":"sha256:8d874806d9c53c44e5ef2db4ed96b84a22fbf19909c1eb3f286f45445af1c544","observation_id":"278f370a-80b5-44b6-a12b-531f5c1727f3","resolution":{"observed_at":"2026-08-02T07:36:50.585263Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:36:50.645050Z","title":"Introducing","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.20536","last_updated":"2026-07-10T16:55:04Z","snapshot_observed_at":"2026-08-08T12:24:06.472564Z","submitted_at":"2026-07-10T16:55:04Z","title":"AppWorld-UL: Benchmarking Diverse Agent-User Interactions for Tool-Use","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-02T07:36:50.645050Z"},"links":{"citing_paper":"/paper/2607.20536"},"observation_digest":"sha256:da023a3e696334c9b088fea181fddb09c8898c1a7893f5f5e82c4a4cdacb5f83","observation_id":"0fd67764-d488-4566-b783-de1c0181edb5","resolution":{"observed_at":"2026-08-02T07:36:50.645050Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:36:50.794834Z","title":"Introducing","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.20536","last_updated":"2026-07-10T16:55:04Z","snapshot_observed_at":"2026-08-08T12:24:06.472564Z","submitted_at":"2026-07-10T16:55:04Z","title":"AppWorld-UL: Benchmarking Diverse Agent-User Interactions for Tool-Use","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-02T07:36:50.794834Z"},"links":{"citing_paper":"/paper/2607.20536"},"observation_digest":"sha256:361ab45904c53bc07b4b16bd44b2ad6ec179fd95e0a8dc47b7528d0c2291fe31","observation_id":"594fdc9a-57ae-42eb-9a75-30c922b1a8bc","resolution":{"observed_at":"2026-08-02T07:36:50.794834Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:36:50.966365Z","title":"Introducing","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.20536","last_updated":"2026-07-10T16:55:04Z","snapshot_observed_at":"2026-08-08T12:24:06.472564Z","submitted_at":"2026-07-10T16:55:04Z","title":"AppWorld-UL: Benchmarking Diverse Agent-User Interactions for Tool-Use","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-02T07:36:50.966365Z"},"links":{"citing_paper":"/paper/2607.20536"},"observation_digest":"sha256:9a0d820cf32e0f08fcf13958f9b5bb626aecf86674c887a8c92e448374ff6734","observation_id":"d82c5068-1c11-4a7a-92cf-7cbd06ba75fe","resolution":{"observed_at":"2026-08-02T07:36:50.966365Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:36:51.134839Z","title":"2023 , url=","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.20536","last_updated":"2026-07-10T16:55:04Z","snapshot_observed_at":"2026-08-08T12:24:06.472564Z","submitted_at":"2026-07-10T16:55:04Z","title":"AppWorld-UL: Benchmarking Diverse Agent-User Interactions for Tool-Use","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-02T07:36:51.134839Z"},"links":{"citing_paper":"/paper/2607.20536"},"observation_digest":"sha256:44c9ef6be8bca41a146051dd9d86632d5eb0728e7087ced6796f080bf939cf13","observation_id":"58a05d87-ae62-45be-a7a5-12f87315dbf0","resolution":{"observed_at":"2026-08-02T07:36:51.134839Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:36:51.288610Z","title":"Introducing C laude S onnet 4.5, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.20536","last_updated":"2026-07-10T16:55:04Z","snapshot_observed_at":"2026-08-08T12:24:06.472564Z","submitted_at":"2026-07-10T16:55:04Z","title":"AppWorld-UL: Benchmarking Diverse Agent-User Interactions for Tool-Use","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-02T07:36:51.288610Z"},"links":{"citing_paper":"/paper/2607.20536"},"observation_digest":"sha256:3f1c49e564e5397e96411d4c581b5e6d4a1725c400aba6c49e98f4aacd8a25f2","observation_id":"a2adea71-4086-4714-8f1a-9fa40ea67a62","resolution":{"observed_at":"2026-08-02T07:36:51.288610Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.07982","last_updated":"2025-06-09T17:52:18Z","snapshot_observed_at":"2026-07-06T21:39:13.304260Z","submitted_at":"2025-06-09T17:52:18Z","title":"$\\tau^2$-Bench: Evaluating Conversational Agents in a Dual-Control Environment","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.07982","snapshot_observed_at":"2026-08-02T07:36:51.458787Z","title":"^2 -bench: Evaluating conversational agents in a dual-control environment, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.20536","last_updated":"2026-07-10T16:55:04Z","snapshot_observed_at":"2026-08-08T12:24:06.472564Z","submitted_at":"2026-07-10T16:55:04Z","title":"AppWorld-UL: Benchmarking Diverse Agent-User Interactions for Tool-Use","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-02T07:36:51.458787Z"},"links":{"cited_paper":"/paper/2506.07982","citing_paper":"/paper/2607.20536"},"observation_digest":"sha256:85919199df0de8f7b40be05e1ea660ba83399999faf64e6fcb4ac976848b6e6a","observation_id":"3f3016ae-5441-4797-986a-9012e4effe4e","resolution":{"observed_at":"2026-08-02T07:36:51.458787Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:36:51.545006Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.20536","last_updated":"2026-07-10T16:55:04Z","snapshot_observed_at":"2026-08-08T12:24:06.472564Z","submitted_at":"2026-07-10T16:55:04Z","title":"AppWorld-UL: Benchmarking Diverse Agent-User Interactions for Tool-Use","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-02T07:36:51.545006Z"},"links":{"citing_paper":"/paper/2607.20536"},"observation_digest":"sha256:d0f009a0e17ad37afe98cd7932bf24d31d4db049d1f76e8d2ddc42d300b06355","observation_id":"c117eaa2-5fe0-4e8a-b34a-4427d21c5b88","resolution":{"observed_at":"2026-08-02T07:36:51.545006Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:36:51.731493Z","title":"C., Fourney, A., Gerrits, J., Zhu, E","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.20536","last_updated":"2026-07-10T16:55:04Z","snapshot_observed_at":"2026-08-08T12:24:06.472564Z","submitted_at":"2026-07-10T16:55:04Z","title":"AppWorld-UL: Benchmarking Diverse Agent-User Interactions for Tool-Use","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-02T07:36:51.731493Z"},"links":{"citing_paper":"/paper/2607.20536"},"observation_digest":"sha256:a96ee5af7e4923b7327e1e786d56434d5d399d5f7e0818e26bf7c25bbb2af29d","observation_id":"650df353-8e93-4635-8821-42aef73789b8","resolution":{"observed_at":"2026-08-02T07:36:51.731493Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:36:51.994991Z","title":"Introducing G emini 3, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.20536","last_updated":"2026-07-10T16:55:04Z","snapshot_observed_at":"2026-08-08T12:24:06.472564Z","submitted_at":"2026-07-10T16:55:04Z","title":"AppWorld-UL: Benchmarking Diverse Agent-User Interactions for Tool-Use","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-02T07:36:51.994991Z"},"links":{"citing_paper":"/paper/2607.20536"},"observation_digest":"sha256:0bf01ef33920084bbda10c9bcb7f4b5b82f1dc212c5199d3f6934a8fb4b752df","observation_id":"ef820777-5da0-4272-901b-9ab99fdce222","resolution":{"observed_at":"2026-08-02T07:36:51.994991Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:36:52.141312Z","title":"H., Hao, H., Gou, L., and Ren, L","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.20536","last_updated":"2026-07-10T16:55:04Z","snapshot_observed_at":"2026-08-08T12:24:06.472564Z","submitted_at":"2026-07-10T16:55:04Z","title":"AppWorld-UL: Benchmarking Diverse Agent-User Interactions for Tool-Use","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-02T07:36:52.141312Z"},"links":{"citing_paper":"/paper/2607.20536"},"observation_digest":"sha256:74ece5a48867cbfc8d7993144506affc88a512070fb55148739b2cc03ddeccd1","observation_id":"b262f913-1124-4f5f-a9b5-5fc2f57a5117","resolution":{"observed_at":"2026-08-02T07:36:52.141312Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:36:52.325028Z","title":"Plan-then-execute: An empirical study of user trust and team performance when using LLM agents as a daily assistant","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.20536","last_updated":"2026-07-10T16:55:04Z","snapshot_observed_at":"2026-08-08T12:24:06.472564Z","submitted_at":"2026-07-10T16:55:04Z","title":"AppWorld-UL: Benchmarking Diverse Agent-User Interactions for Tool-Use","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-02T07:36:52.325028Z"},"links":{"citing_paper":"/paper/2607.20536"},"observation_digest":"sha256:02e662838a1ccb5e50cfd99e4cfa6ff5d461ceceb30d090bb245f8c5f1039185","observation_id":"300a626b-b3a8-449b-933b-d87ec178e520","resolution":{"observed_at":"2026-08-02T07:36:52.325028Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:36:52.462388Z","title":"E., Yang, J., Wettig, A., Yao, S., Pei, K., Press, O., and Narasimhan, K","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.20536","last_updated":"2026-07-10T16:55:04Z","snapshot_observed_at":"2026-08-08T12:24:06.472564Z","submitted_at":"2026-07-10T16:55:04Z","title":"AppWorld-UL: Benchmarking Diverse Agent-User Interactions for Tool-Use","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-02T07:36:52.462388Z"},"links":{"citing_paper":"/paper/2607.20536"},"observation_digest":"sha256:252e80758a6d75f428cd5aef36c0e534350275b17eb8edd4e24ff0a1e13625f9","observation_id":"7287d0eb-d3d6-4471-b440-badcaab0b9f6","resolution":{"observed_at":"2026-08-02T07:36:52.462388Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:36:52.674736Z","title":"DiaryMate : Understanding user perceptions and experience in human- AI collaboration for personal journaling","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.20536","last_updated":"2026-07-10T16:55:04Z","snapshot_observed_at":"2026-08-08T12:24:06.472564Z","submitted_at":"2026-07-10T16:55:04Z","title":"AppWorld-UL: Benchmarking Diverse Agent-User Interactions for Tool-Use","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-02T07:36:52.674736Z"},"links":{"citing_paper":"/paper/2607.20536"},"observation_digest":"sha256:1577c7b0a595533144f2f0b6a703807925465922f588e49e5ca186e024df7a79","observation_id":"699fb314-0b5d-446f-ac84-191e953180db","resolution":{"observed_at":"2026-08-02T07:36:52.674736Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:36:52.844980Z","title":"Introducing Kimi K2 Thinking , 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.20536","last_updated":"2026-07-10T16:55:04Z","snapshot_observed_at":"2026-08-08T12:24:06.472564Z","submitted_at":"2026-07-10T16:55:04Z","title":"AppWorld-UL: Benchmarking Diverse Agent-User Interactions for Tool-Use","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-02T07:36:52.844980Z"},"links":{"citing_paper":"/paper/2607.20536"},"observation_digest":"sha256:531306a57d2994461ac29ebb5393b10eb0831ec0e8550f349ec30b2a09e61e85","observation_id":"6715f115-99a3-4dde-961d-403c8c193300","resolution":{"observed_at":"2026-08-02T07:36:52.844980Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.16232","last_updated":"2024-10-21T17:39:49Z","snapshot_observed_at":"2026-08-06T08:14:59.264972Z","submitted_at":"2024-10-21T17:39:49Z","title":"Sketch2Code: Evaluating Vision-Language Models for Interactive Web Design Prototyping","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.16232","snapshot_observed_at":"2026-08-02T07:36:53.056837Z","title":"Sketch2Code : Evaluating vision-language models for interactive web design prototyping, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.20536","last_updated":"2026-07-10T16:55:04Z","snapshot_observed_at":"2026-08-08T12:24:06.472564Z","submitted_at":"2026-07-10T16:55:04Z","title":"AppWorld-UL: Benchmarking Diverse Agent-User Interactions for Tool-Use","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-02T07:36:53.056837Z"},"links":{"cited_paper":"/paper/2410.16232","citing_paper":"/paper/2607.20536"},"observation_digest":"sha256:16186803ed6c142df0b94abbf291de596cb8875ff4b696c8c84c92ed32fce31e","observation_id":"dfa5d70a-4d9b-4a52-b425-e6bf11b70f16","resolution":{"observed_at":"2026-08-02T07:36:53.056837Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.04682","last_updated":"2025-04-16T22:20:21Z","snapshot_observed_at":"2026-08-07T09:28:51.797713Z","submitted_at":"2024-08-08T05:45:42Z","title":"ToolSandbox: A Stateful, Conversational, Interactive Evaluation Benchmark for LLM Tool Use Capabilities","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.04682","snapshot_observed_at":"2026-08-02T07:36:53.348031Z","title":"ToolSandbox : A stateful, conversational, interactive evaluation benchmark for LLM tool use capabilities, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.20536","last_updated":"2026-07-10T16:55:04Z","snapshot_observed_at":"2026-08-08T12:24:06.472564Z","submitted_at":"2026-07-10T16:55:04Z","title":"AppWorld-UL: Benchmarking Diverse Agent-User Interactions for Tool-Use","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-02T07:36:53.348031Z"},"links":{"cited_paper":"/paper/2408.04682","citing_paper":"/paper/2607.20536"},"observation_digest":"sha256:194692c8d58c44372bf75241eb04f153f11e4ae646c5ecf85af4689768cdbc79","observation_id":"29be73f0-dce0-478d-bf47-45b0d02832d4","resolution":{"observed_at":"2026-08-02T07:36:53.348031Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:36:53.564740Z","title":"User interaction patterns and breakdowns in conversing with LLM -powered voice assistants","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.20536","last_updated":"2026-07-10T16:55:04Z","snapshot_observed_at":"2026-08-08T12:24:06.472564Z","submitted_at":"2026-07-10T16:55:04Z","title":"AppWorld-UL: Benchmarking Diverse Agent-User Interactions for Tool-Use","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-02T07:36:53.564740Z"},"links":{"citing_paper":"/paper/2607.20536"},"observation_digest":"sha256:15c0a305f6ab1adf5f4d1f91d620801e3c1bb9f4cdaf2b813058c3c1e8d1bbd5","observation_id":"859cf7f9-73c1-4e77-a039-9755253ff457","resolution":{"observed_at":"2026-08-02T07:36:53.564740Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:36:53.659322Z","title":"C.-J., Huang, J., Suresh, V., Huang, Y., Yu, X., Gonzalez, J","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.20536","last_updated":"2026-07-10T16:55:04Z","snapshot_observed_at":"2026-08-08T12:24:06.472564Z","submitted_at":"2026-07-10T16:55:04Z","title":"AppWorld-UL: Benchmarking Diverse Agent-User Interactions for Tool-Use","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-02T07:36:53.659322Z"},"links":{"citing_paper":"/paper/2607.20536"},"observation_digest":"sha256:0e67a6a46d814b7e544ddba9f3958268bd7941b4041eb4cc670868a3315a4e75","observation_id":"945e62d7-14d4-4ef7-bd86-9c914da4ac86","resolution":{"observed_at":"2026-08-02T07:36:53.659322Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2601.11868","last_updated":"2026-01-17T01:29:30Z","snapshot_observed_at":"2026-07-06T22:41:58.373427Z","submitted_at":"2026-01-17T01:29:30Z","title":"Terminal-Bench: Benchmarking Agents on Hard, Realistic Tasks in Command Line Interfaces","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2601.11868","snapshot_observed_at":"2026-08-02T07:36:53.809474Z","title":"A., Shaw, A","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.20536","last_updated":"2026-07-10T16:55:04Z","snapshot_observed_at":"2026-08-08T12:24:06.472564Z","submitted_at":"2026-07-10T16:55:04Z","title":"AppWorld-UL: Benchmarking Diverse Agent-User Interactions for Tool-Use","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-02T07:36:53.809474Z"},"links":{"cited_paper":"/paper/2601.11868","citing_paper":"/paper/2607.20536"},"observation_digest":"sha256:625539d0730dadfc528edf4b36bdcfc93cc202710e325cf682cdbd63f6f99a69","observation_id":"45664995-ead0-449e-847f-e9d461cdd72b","resolution":{"observed_at":"2026-08-02T07:36:53.809474Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:36:53.944969Z","title":"Reading between the lines: Modeling user behavior and costs in AI -assisted programming","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.20536","last_updated":"2026-07-10T16:55:04Z","snapshot_observed_at":"2026-08-08T12:24:06.472564Z","submitted_at":"2026-07-10T16:55:04Z","title":"AppWorld-UL: Benchmarking Diverse Agent-User Interactions for Tool-Use","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-02T07:36:53.944969Z"},"links":{"citing_paper":"/paper/2607.20536"},"observation_digest":"sha256:243d518f73ee3d4ae658a8c6d8bf556599ae949ddff334be9138bc4c211bdfa3","observation_id":"94efaf07-6316-484b-9070-7f261cd42737","resolution":{"observed_at":"2026-08-02T07:36:53.944969Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:36:54.054842Z","title":"Introducing GPT-5 , 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.20536","last_updated":"2026-07-10T16:55:04Z","snapshot_observed_at":"2026-08-08T12:24:06.472564Z","submitted_at":"2026-07-10T16:55:04Z","title":"AppWorld-UL: Benchmarking Diverse Agent-User Interactions for Tool-Use","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-02T07:36:54.054842Z"},"links":{"citing_paper":"/paper/2607.20536"},"observation_digest":"sha256:f4210be84173b4f3e3d1db17560362d387f593f0675e5ed73505628e310790e0","observation_id":"05e9b490-6772-4a18-b3ce-31af4904a9e3","resolution":{"observed_at":"2026-08-02T07:36:54.054842Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.22034","last_updated":"2025-07-29T17:34:12Z","snapshot_observed_at":"2026-08-07T20:29:47.386254Z","submitted_at":"2025-07-29T17:34:12Z","title":"UserBench: An Interactive Gym Environment for User-Centric Agents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.22034","snapshot_observed_at":"2026-08-02T07:36:54.184901Z","title":"UserBench : An interactive gym environment for user-centric agents, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.20536","last_updated":"2026-07-10T16:55:04Z","snapshot_observed_at":"2026-08-08T12:24:06.472564Z","submitted_at":"2026-07-10T16:55:04Z","title":"AppWorld-UL: Benchmarking Diverse Agent-User Interactions for Tool-Use","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-02T07:36:54.184901Z"},"links":{"cited_paper":"/paper/2507.22034","citing_paper":"/paper/2607.20536"},"observation_digest":"sha256:9a4f72e687da5d965f4b3b64e972d64b0cd4fe5bcc78f9f1596317061e8c3f7a","observation_id":"de3e0712-6066-4308-9522-0049c04c04aa","resolution":{"observed_at":"2026-08-02T07:36:54.184901Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:36:54.284766Z","title":"Qwen3 : Think deeper, act faster, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.20536","last_updated":"2026-07-10T16:55:04Z","snapshot_observed_at":"2026-08-08T12:24:06.472564Z","submitted_at":"2026-07-10T16:55:04Z","title":"AppWorld-UL: Benchmarking Diverse Agent-User Interactions for Tool-Use","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-02T07:36:54.284766Z"},"links":{"citing_paper":"/paper/2607.20536"},"observation_digest":"sha256:1ee5939ca0e82612d2cfecd33329fbac2dbf19ae5126ef7beed70e47be3bc42f","observation_id":"6f32782a-3ba6-4768-b02b-834ab8336cb5","resolution":{"observed_at":"2026-08-02T07:36:54.284766Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:36:54.455020Z","title":"Lost in simulation: LLM -simulated users are unreliable proxies for human users in agentic evaluations, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.20536","last_updated":"2026-07-10T16:55:04Z","snapshot_observed_at":"2026-08-08T12:24:06.472564Z","submitted_at":"2026-07-10T16:55:04Z","title":"AppWorld-UL: Benchmarking Diverse Agent-User Interactions for Tool-Use","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-02T07:36:54.455020Z"},"links":{"citing_paper":"/paper/2607.20536"},"observation_digest":"sha256:0ef8c29ee109a5b90607cdf88f0fb508f02de8a78d449bebfc822ac903d80a20","observation_id":"81905a40-7c35-4ea7-8955-06f217fe04d4","resolution":{"observed_at":"2026-08-02T07:36:54.455020Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:36:54.555176Z","title":"Bridging the gulf of envisioning: Cognitive challenges in prompt based interactions with LLM s","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.20536","last_updated":"2026-07-10T16:55:04Z","snapshot_observed_at":"2026-08-08T12:24:06.472564Z","submitted_at":"2026-07-10T16:55:04Z","title":"AppWorld-UL: Benchmarking Diverse Agent-User Interactions for Tool-Use","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-02T07:36:54.555176Z"},"links":{"citing_paper":"/paper/2607.20536"},"observation_digest":"sha256:cfe6626165a336840ce9836f4a3f91532ed2ce188cc6142a80bb97238d3080e9","observation_id":"a1e303d1-861e-4c42-babd-6af8374a3285","resolution":{"observed_at":"2026-08-02T07:36:54.555176Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:36:54.635867Z","title":"A pp W orld: A controllable world of apps and people for benchmarking interactive coding agents","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.20536","last_updated":"2026-07-10T16:55:04Z","snapshot_observed_at":"2026-08-08T12:24:06.472564Z","submitted_at":"2026-07-10T16:55:04Z","title":"AppWorld-UL: Benchmarking Diverse Agent-User Interactions for Tool-Use","version":1},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-02T07:36:54.635867Z"},"links":{"citing_paper":"/paper/2607.20536"},"observation_digest":"sha256:39fb9d63fc6c301479989fc98a73e058035f49560a06ea5fcc9fe9037e45a07c","observation_id":"f04244ad-ae9d-4177-824b-d17739d7fe47","resolution":{"observed_at":"2026-08-02T07:36:54.635867Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:36:54.708301Z","title":"R., and Cao, Y","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.20536","last_updated":"2026-07-10T16:55:04Z","snapshot_observed_at":"2026-08-08T12:24:06.472564Z","submitted_at":"2026-07-10T16:55:04Z","title":"AppWorld-UL: Benchmarking Diverse Agent-User Interactions for Tool-Use","version":1},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-02T07:36:54.708301Z"},"links":{"citing_paper":"/paper/2607.20536"},"observation_digest":"sha256:f51af4f63dbb4f1d22047d065cfd3d55b91db1c734374c71ad400b9b45bec30c","observation_id":"a9b65825-1d81-468b-bc7f-1e23161335a6","resolution":{"observed_at":"2026-08-02T07:36:54.708301Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.12045","last_updated":"2024-06-17T19:33:08Z","snapshot_observed_at":"2026-08-08T21:08:39.676079Z","submitted_at":"2024-06-17T19:33:08Z","title":"$\\tau$-bench: A Benchmark for Tool-Agent-User Interaction in Real-World Domains","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.12045","snapshot_observed_at":"2026-08-02T07:36:54.776772Z","title":"-bench: A benchmark for tool-agent-user interaction in real-world domains, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.20536","last_updated":"2026-07-10T16:55:04Z","snapshot_observed_at":"2026-08-08T12:24:06.472564Z","submitted_at":"2026-07-10T16:55:04Z","title":"AppWorld-UL: Benchmarking Diverse Agent-User Interactions for Tool-Use","version":1},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-02T07:36:54.776772Z"},"links":{"cited_paper":"/paper/2406.12045","citing_paper":"/paper/2607.20536"},"observation_digest":"sha256:94dc43e83697d02a05454c948cc43044a61b405837d3ceb5d61f322f1252b0a1","observation_id":"010a2e09-2aa9-48d7-915e-fcf56b43e163","resolution":{"observed_at":"2026-08-02T07:36:54.776772Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:36:54.894752Z","title":"F., Zhu, H., Zhou, X., Lo, R., Sridhar, A., Cheng, X., Ou, T., Bisk, Y., Fried, D., Alon, U., and Neubig, G","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.20536","last_updated":"2026-07-10T16:55:04Z","snapshot_observed_at":"2026-08-08T12:24:06.472564Z","submitted_at":"2026-07-10T16:55:04Z","title":"AppWorld-UL: Benchmarking Diverse Agent-User Interactions for Tool-Use","version":1},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-02T07:36:54.894752Z"},"links":{"citing_paper":"/paper/2607.20536"},"observation_digest":"sha256:575555a787a85bdb6e3802c875d2fa16e7596bae7872a395feb17fb5a405ef3c","observation_id":"f016c909-2c3a-4faa-9bd9-dde3d352db40","resolution":{"observed_at":"2026-08-02T07:36:54.894752Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.15478","last_updated":"2025-03-19T17:55:08Z","snapshot_observed_at":"2026-08-08T21:39:18.091217Z","submitted_at":"2025-03-19T17:55:08Z","title":"SWEET-RL: Training Multi-Turn LLM Agents on Collaborative Reasoning Tasks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.15478","snapshot_observed_at":"2026-08-02T07:36:55.011277Z","title":"SWEET-RL : Training multi-turn LLM agents on collaborative reasoning tasks, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.20536","last_updated":"2026-07-10T16:55:04Z","snapshot_observed_at":"2026-08-08T12:24:06.472564Z","submitted_at":"2026-07-10T16:55:04Z","title":"AppWorld-UL: Benchmarking Diverse Agent-User Interactions for Tool-Use","version":1},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-02T07:36:55.011277Z"},"links":{"cited_paper":"/paper/2503.15478","citing_paper":"/paper/2607.20536"},"observation_digest":"sha256:7df4d31cb8d6d7b1b034826e0975928f12f648f50256f6be0220d8e0cf346a12","observation_id":"2e6c0734-d37c-44a7-ab34-e99e658384e5","resolution":{"observed_at":"2026-08-02T07:36:55.011277Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.20536","last_updated":"2026-07-10T16:55:04Z","latest_version":1,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-08T12:24:06.472564Z","submitted_at":"2026-07-10T16:55:04Z","title":"AppWorld-UL: Benchmarking Diverse Agent-User Interactions for Tool-Use"},"reference_resolution":{"displayed":53,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":1,"unresolved":52,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":53},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 53 of 53 outbound references and 0 inbound Pith citation observations for arXiv:2607.20536."}