{"as_of":"2026-08-10T04:14:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:f93993124d008bda638809168df0be96ab9aa348610681a184e6bd38aa7e5336","coverage":[{"denominator":53,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":53,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T08:32:49.575837Z","state":"measured"},{"denominator":53,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":53,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2608.02372/citation-record","integrity":"/paper/2608.02372/integrity","json":"/paper/2608.02372/citation-record.json","paper":"/paper/2608.02372"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T08:32:43.743272Z","title":"Claude Haiku 4.5 System Card","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.02372","last_updated":"2026-08-03T15:15:55Z","snapshot_observed_at":"2026-08-08T16:06:41.492085Z","submitted_at":"2026-08-03T15:15:55Z","title":"PredAct-Bench: Benchmarking Tool-Augmented Dialogue under Controlled Tool Noise","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-04T08:32:43.743272Z"},"links":{"citing_paper":"/paper/2608.02372"},"observation_digest":"sha256:806fb38fbaf7abca5d5840c83eb6ca4d31f14781ae412926d8fe01e0c0fa5d6c","observation_id":"504de7a3-c67a-47a9-8bcc-9fc7f327b4a1","resolution":{"observed_at":"2026-08-04T08:32:43.743272Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T08:32:43.873998Z","title":"Claude Opus 4.7 System Card","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.02372","last_updated":"2026-08-03T15:15:55Z","snapshot_observed_at":"2026-08-08T16:06:41.492085Z","submitted_at":"2026-08-03T15:15:55Z","title":"PredAct-Bench: Benchmarking Tool-Augmented Dialogue under Controlled Tool Noise","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-04T08:32:43.873998Z"},"links":{"citing_paper":"/paper/2608.02372"},"observation_digest":"sha256:c59d721bf4b5f72fa0450c37f85d0d80a4ec5877505277cf9cb147f74c97ceb7","observation_id":"d6651767-5d6b-4e87-9e57-7be3754334cf","resolution":{"observed_at":"2026-08-04T08:32:43.873998Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.07982","last_updated":"2025-06-09T17:52:18Z","snapshot_observed_at":"2026-07-06T21:39:13.304260Z","submitted_at":"2025-06-09T17:52:18Z","title":"$\\tau^2$-Bench: Evaluating Conversational Agents in a Dual-Control Environment","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.07982","snapshot_observed_at":"2026-08-04T08:32:43.971429Z","title":"τ 2-bench: Evaluating conversational agents in a dual-control environment, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.02372","last_updated":"2026-08-03T15:15:55Z","snapshot_observed_at":"2026-08-08T16:06:41.492085Z","submitted_at":"2026-08-03T15:15:55Z","title":"PredAct-Bench: Benchmarking Tool-Augmented Dialogue under Controlled Tool Noise","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-04T08:32:43.971429Z"},"links":{"cited_paper":"/paper/2506.07982","citing_paper":"/paper/2608.02372"},"observation_digest":"sha256:a2330f0f0f90234001c887b5d1f093720f9ade3f75e1b25dff0b87188df05ef9","observation_id":"cb68e588-dc12-4889-a02c-ae1a043ca196","resolution":{"observed_at":"2026-08-04T08:32:43.971429Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T08:32:44.072039Z","title":"MultiWOZ - a large-scale multi-domain Wizard-of-Oz dataset for task-oriented dialogue modelling","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2608.02372","last_updated":"2026-08-03T15:15:55Z","snapshot_observed_at":"2026-08-08T16:06:41.492085Z","submitted_at":"2026-08-03T15:15:55Z","title":"PredAct-Bench: Benchmarking Tool-Augmented Dialogue under Controlled Tool Noise","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-04T08:32:44.072039Z"},"links":{"citing_paper":"/paper/2608.02372"},"observation_digest":"sha256:82b6b440bf88c2937cc54614793253f78e1f56fbbcd588a03547b728f4804e7c","observation_id":"c61c0bf5-ac1a-4ccb-8fc9-43d31a4b96a6","resolution":{"observed_at":"2026-08-04T08:32:44.072039Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T08:32:44.169178Z","title":"Timebench: A comprehensive evaluation of temporal reasoning abilities in large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.02372","last_updated":"2026-08-03T15:15:55Z","snapshot_observed_at":"2026-08-08T16:06:41.492085Z","submitted_at":"2026-08-03T15:15:55Z","title":"PredAct-Bench: Benchmarking Tool-Augmented Dialogue under Controlled Tool Noise","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-04T08:32:44.169178Z"},"links":{"citing_paper":"/paper/2608.02372"},"observation_digest":"sha256:5fb0a80606fb1633ebc3cbba51cdb1d7c30a087223cca2775ed847ca7c2a8fe5","observation_id":"e8cba22b-efea-4878-94e8-fe83925c57f7","resolution":{"observed_at":"2026-08-04T08:32:44.169178Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T08:32:44.284896Z","title":"Timer: Temporal instruction modeling and evaluation for longitudinal clinical records.npj Digital Medicine, 8(1):577, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.02372","last_updated":"2026-08-03T15:15:55Z","snapshot_observed_at":"2026-08-08T16:06:41.492085Z","submitted_at":"2026-08-03T15:15:55Z","title":"PredAct-Bench: Benchmarking Tool-Augmented Dialogue under Controlled Tool Noise","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-04T08:32:44.284896Z"},"links":{"citing_paper":"/paper/2608.02372"},"observation_digest":"sha256:33bdfaf107e11dbb3f27b3842cf88e36ed3a1e774bf5261975b0b1fc58f01cde","observation_id":"8fef0fec-1a1b-4150-a7fc-761f7621088e","resolution":{"observed_at":"2026-08-04T08:32:44.284896Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T08:32:44.458523Z","title":"Deepseek-v4: Towards highly efficient million-token context intelligence, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.02372","last_updated":"2026-08-03T15:15:55Z","snapshot_observed_at":"2026-08-08T16:06:41.492085Z","submitted_at":"2026-08-03T15:15:55Z","title":"PredAct-Bench: Benchmarking Tool-Augmented Dialogue under Controlled Tool Noise","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-04T08:32:44.458523Z"},"links":{"citing_paper":"/paper/2608.02372"},"observation_digest":"sha256:671e8694f0563873284d52308a5a4548a3ad4bf9142bf3a7cb06cd5d28be43e1","observation_id":"b4ce5431-deca-4e9f-a547-6dd8fb684c4c","resolution":{"observed_at":"2026-08-04T08:32:44.458523Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T08:32:44.629181Z","title":"Mind2web: Towards a generalist agent for the web","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.02372","last_updated":"2026-08-03T15:15:55Z","snapshot_observed_at":"2026-08-08T16:06:41.492085Z","submitted_at":"2026-08-03T15:15:55Z","title":"PredAct-Bench: Benchmarking Tool-Augmented Dialogue under Controlled Tool Noise","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-04T08:32:44.629181Z"},"links":{"citing_paper":"/paper/2608.02372"},"observation_digest":"sha256:b04aacb53d32b63174baa06b884d19cb35e7ddefeffa8fcfcbe9ad176d923ef0","observation_id":"3cca429d-0fc0-4c08-a55c-1c4a31f629a2","resolution":{"observed_at":"2026-08-04T08:32:44.629181Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T08:32:44.770225Z","title":"MultiWOZ 2.1: A consol- idated multi-domain dialogue dataset with state corrections and state tracking baselines","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2608.02372","last_updated":"2026-08-03T15:15:55Z","snapshot_observed_at":"2026-08-08T16:06:41.492085Z","submitted_at":"2026-08-03T15:15:55Z","title":"PredAct-Bench: Benchmarking Tool-Augmented Dialogue under Controlled Tool Noise","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-04T08:32:44.770225Z"},"links":{"citing_paper":"/paper/2608.02372"},"observation_digest":"sha256:dbf938d3b4ba9c7f6c2a68fc1b90a326c4ae9e339b7e097a29baa18ea2d179c4","observation_id":"8ce20688-edbe-45a7-9bb0-5f444207b151","resolution":{"observed_at":"2026-08-04T08:32:44.770225Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T08:32:44.861482Z","title":"Verification of forecasts expressed in terms of probability.Monthly weather review, 78(1):1–3, 1950","venue":null,"work_id":null,"year":1950},"citing_paper":{"arxiv_id":"2608.02372","last_updated":"2026-08-03T15:15:55Z","snapshot_observed_at":"2026-08-08T16:06:41.492085Z","submitted_at":"2026-08-03T15:15:55Z","title":"PredAct-Bench: Benchmarking Tool-Augmented Dialogue under Controlled Tool Noise","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-04T08:32:44.861482Z"},"links":{"citing_paper":"/paper/2608.02372"},"observation_digest":"sha256:42944c4f1a182cb3cbfd678f21b7d211b4e5a5409c56641b1ebd73b069134b54","observation_id":"72ffb4de-1d67-4d89-8d48-91273adfc39b","resolution":{"observed_at":"2026-08-04T08:32:44.861482Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T08:32:45.014107Z","title":"Gemini 3 Flash Model Card","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.02372","last_updated":"2026-08-03T15:15:55Z","snapshot_observed_at":"2026-08-08T16:06:41.492085Z","submitted_at":"2026-08-03T15:15:55Z","title":"PredAct-Bench: Benchmarking Tool-Augmented Dialogue under Controlled Tool Noise","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-04T08:32:45.014107Z"},"links":{"citing_paper":"/paper/2608.02372"},"observation_digest":"sha256:e3305d200521a48efc25f7f77095c7a3574ba9008bbb14936702c7b85491a8f6","observation_id":"00a40c3e-78a1-42fe-ac92-2c25ac880ac6","resolution":{"observed_at":"2026-08-04T08:32:45.014107Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T08:32:45.136049Z","title":"Gemini 3.1 Pro Model Card","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.02372","last_updated":"2026-08-03T15:15:55Z","snapshot_observed_at":"2026-08-08T16:06:41.492085Z","submitted_at":"2026-08-03T15:15:55Z","title":"PredAct-Bench: Benchmarking Tool-Augmented Dialogue under Controlled Tool Noise","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-04T08:32:45.136049Z"},"links":{"citing_paper":"/paper/2608.02372"},"observation_digest":"sha256:0ef7729cc89fdc592194f2e9f2d2a50a30753c1099722ecd5a4f322f69813b05","observation_id":"a3bf996f-f749-4ae0-859c-fc4493a44e5b","resolution":{"observed_at":"2026-08-04T08:32:45.136049Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T08:32:45.233219Z","title":"Weinberger","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2608.02372","last_updated":"2026-08-03T15:15:55Z","snapshot_observed_at":"2026-08-08T16:06:41.492085Z","submitted_at":"2026-08-03T15:15:55Z","title":"PredAct-Bench: Benchmarking Tool-Augmented Dialogue under Controlled Tool Noise","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-04T08:32:45.233219Z"},"links":{"citing_paper":"/paper/2608.02372"},"observation_digest":"sha256:b5e894703c852cef95cd02bbe056e474812834b610d4714d188a316336adefb6","observation_id":"b067a85c-c5c5-46a1-8cb9-b206d13a74bb","resolution":{"observed_at":"2026-08-04T08:32:45.233219Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T08:32:45.318824Z","title":"Multiwoz 2.3: A multi-domain task-oriented dialogue dataset enhanced with annotation corrections and co-reference annotation","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.02372","last_updated":"2026-08-03T15:15:55Z","snapshot_observed_at":"2026-08-08T16:06:41.492085Z","submitted_at":"2026-08-03T15:15:55Z","title":"PredAct-Bench: Benchmarking Tool-Augmented Dialogue under Controlled Tool Noise","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-04T08:32:45.318824Z"},"links":{"citing_paper":"/paper/2608.02372"},"observation_digest":"sha256:6c54ae427ee7caff963ec15104a723e13d721486d6583aed8417c0ba1dabcdf1","observation_id":"07f4bd87-66ad-4a6f-a044-5613a91275f4","resolution":{"observed_at":"2026-08-04T08:32:45.318824Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2025.findings-acl.378","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Towards explainable temporal reasoning in large language models: A structure-aware generative framework","venue":null,"work_id":"9d39d17e-bc9b-4d46-9ac9-0824c0d5b236","year":2025},"citing_paper":{"arxiv_id":"2608.02372","last_updated":"2026-08-03T15:15:55Z","snapshot_observed_at":"2026-08-08T16:06:41.492085Z","submitted_at":"2026-08-03T15:15:55Z","title":"PredAct-Bench: Benchmarking Tool-Augmented Dialogue under Controlled Tool Noise","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-04T08:32:45.449837Z"},"links":{"citing_paper":"/paper/2608.02372"},"observation_digest":"sha256:94d663e71e0c8c7b98dc9a010a824eb31c2028d6356fb9130128d20cfaf974b2","observation_id":"830417f9-cd75-43b6-afd5-a1ca3fe3b38c","resolution":{"observed_at":"2026-08-04T08:33:23.343722Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2604.02668","last_updated":"2026-07-14T19:09:34Z","snapshot_observed_at":"2026-08-02T16:57:38.828564Z","submitted_at":"2026-04-03T03:02:42Z","title":"Too Polite to Disagree: Understanding Sycophancy Propagation in Multi-Agent Systems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.02668","snapshot_observed_at":"2026-08-04T08:32:45.556145Z","title":"Too polite to disagree: Understanding sycophancy propagation in multi-agent systems.arXiv preprint arXiv:2604.02668, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.02372","last_updated":"2026-08-03T15:15:55Z","snapshot_observed_at":"2026-08-08T16:06:41.492085Z","submitted_at":"2026-08-03T15:15:55Z","title":"PredAct-Bench: Benchmarking Tool-Augmented Dialogue under Controlled Tool Noise","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-04T08:32:45.556145Z"},"links":{"cited_paper":"/paper/2604.02668","citing_paper":"/paper/2608.02372"},"observation_digest":"sha256:f94996d69b8ac871d522b57065c1446ae9e17538f073e43963671ab1e0a218ec","observation_id":"08f3d5c5-c7f0-42cc-bb66-d06d2a73ae06","resolution":{"observed_at":"2026-08-04T08:32:45.556145Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T08:32:45.656984Z","title":"Beyond perfect apis: A comprehensive evaluation of llm agents under real-world api complexity, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.02372","last_updated":"2026-08-03T15:15:55Z","snapshot_observed_at":"2026-08-08T16:06:41.492085Z","submitted_at":"2026-08-03T15:15:55Z","title":"PredAct-Bench: Benchmarking Tool-Augmented Dialogue under Controlled Tool Noise","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-04T08:32:45.656984Z"},"links":{"citing_paper":"/paper/2608.02372"},"observation_digest":"sha256:d5d6c07d81c7bbaff9a8ef6ec0d71a9aa08deb2dd9b7a2f075b1feb3b37e0a00","observation_id":"284f6816-524c-4673-b9d1-b91056d127c5","resolution":{"observed_at":"2026-08-04T08:32:45.656984Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T08:32:45.761300Z","title":"Counterfactual-consistency prompting for relative tem- poral understanding in large language models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.02372","last_updated":"2026-08-03T15:15:55Z","snapshot_observed_at":"2026-08-08T16:06:41.492085Z","submitted_at":"2026-08-03T15:15:55Z","title":"PredAct-Bench: Benchmarking Tool-Augmented Dialogue under Controlled Tool Noise","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-04T08:32:45.761300Z"},"links":{"citing_paper":"/paper/2608.02372"},"observation_digest":"sha256:ffecdd0651a9494250a2bc04a7603545569a53a9ccb55d3ba2e4bffd9bd89539","observation_id":"2e060976-f4d5-4e0a-952c-fb79fe3dd40c","resolution":{"observed_at":"2026-08-04T08:32:45.761300Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T08:32:45.875768Z","title":"Open university learning analytics dataset","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2608.02372","last_updated":"2026-08-03T15:15:55Z","snapshot_observed_at":"2026-08-08T16:06:41.492085Z","submitted_at":"2026-08-03T15:15:55Z","title":"PredAct-Bench: Benchmarking Tool-Augmented Dialogue under Controlled Tool Noise","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-04T08:32:45.875768Z"},"links":{"citing_paper":"/paper/2608.02372"},"observation_digest":"sha256:aa7c9015c5961c908ca9cc245318b8755b3ef8c9b09b4f9d8d80bee292336f60","observation_id":"84088aa6-4cc8-4cc2-ac77-616a30bf0104","resolution":{"observed_at":"2026-08-04T08:32:45.875768Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T08:32:45.975785Z","title":"Prefix: Understand and adapt to user preference in human-agent interaction, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.02372","last_updated":"2026-08-03T15:15:55Z","snapshot_observed_at":"2026-08-08T16:06:41.492085Z","submitted_at":"2026-08-03T15:15:55Z","title":"PredAct-Bench: Benchmarking Tool-Augmented Dialogue under Controlled Tool Noise","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-04T08:32:45.975785Z"},"links":{"citing_paper":"/paper/2608.02372"},"observation_digest":"sha256:e3eddcb29c8dc5196b9e7cdfc67813e945ddb4c3442e1a4bdf9119ba7be9cf0e","observation_id":"26a899b7-ad39-479d-b78e-e5d8038d5f50","resolution":{"observed_at":"2026-08-04T08:32:45.975785Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2601.08584","last_updated":"2026-01-13T14:06:03Z","snapshot_observed_at":"2026-08-04T17:10:53.354037Z","submitted_at":"2026-01-13T14:06:03Z","title":"Ministral 3","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2601.08584","snapshot_observed_at":"2026-08-04T08:32:46.082440Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.02372","last_updated":"2026-08-03T15:15:55Z","snapshot_observed_at":"2026-08-08T16:06:41.492085Z","submitted_at":"2026-08-03T15:15:55Z","title":"PredAct-Bench: Benchmarking Tool-Augmented Dialogue under Controlled Tool Noise","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-04T08:32:46.082440Z"},"links":{"cited_paper":"/paper/2601.08584","citing_paper":"/paper/2608.02372"},"observation_digest":"sha256:af3810af52f82a783d5b9696dc5863ea5bd8604ff8d4ea0dad2e4b45642f1bd4","observation_id":"66332d06-a20d-41c4-afb5-9cb5b9bed7b4","resolution":{"observed_at":"2026-08-04T08:32:46.082440Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.22919","last_updated":"2026-05-11T05:46:29Z","snapshot_observed_at":"2026-07-06T21:32:33.515702Z","submitted_at":"2025-05-28T22:43:44Z","title":"ER-Reason: A Benchmark Dataset for LLM Clinical Reasoning in the Emergency Room","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.22919","snapshot_observed_at":"2026-08-04T08:32:46.218986Z","title":"Molina, and Ahmed Alaa","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.02372","last_updated":"2026-08-03T15:15:55Z","snapshot_observed_at":"2026-08-08T16:06:41.492085Z","submitted_at":"2026-08-03T15:15:55Z","title":"PredAct-Bench: Benchmarking Tool-Augmented Dialogue under Controlled Tool Noise","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-04T08:32:46.218986Z"},"links":{"cited_paper":"/paper/2505.22919","citing_paper":"/paper/2608.02372"},"observation_digest":"sha256:b74ab20e02f8702f2247a3d4dad8b7f4c100ef37679a3e408488dfdf43ac7025","observation_id":"255100c5-8742-4475-b396-e1400a260400","resolution":{"observed_at":"2026-08-04T08:32:46.218986Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T08:32:46.348786Z","title":"Mistral-Small-24B-Instruct-2501","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.02372","last_updated":"2026-08-03T15:15:55Z","snapshot_observed_at":"2026-08-08T16:06:41.492085Z","submitted_at":"2026-08-03T15:15:55Z","title":"PredAct-Bench: Benchmarking Tool-Augmented Dialogue under Controlled Tool Noise","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-04T08:32:46.348786Z"},"links":{"citing_paper":"/paper/2608.02372"},"observation_digest":"sha256:211777c3ddcd608921f5d6b5984b5585a916aca884d995c712aab931f8126ec8","observation_id":"b1e86b4c-fcf0-4065-85c7-3749efa01303","resolution":{"observed_at":"2026-08-04T08:32:46.348786Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T08:32:46.464972Z","title":"Time is encoded in the weights of finetuned language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.02372","last_updated":"2026-08-03T15:15:55Z","snapshot_observed_at":"2026-08-08T16:06:41.492085Z","submitted_at":"2026-08-03T15:15:55Z","title":"PredAct-Bench: Benchmarking Tool-Augmented Dialogue under Controlled Tool Noise","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-04T08:32:46.464972Z"},"links":{"citing_paper":"/paper/2608.02372"},"observation_digest":"sha256:851d2617c24751a8e66bf5beda86a811d16e53fa32a2ae3a418177a8f627d177","observation_id":"71686b62-e7c6-459a-bd70-7a6636cb7f99","resolution":{"observed_at":"2026-08-04T08:32:46.464972Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T08:32:46.582534Z","title":"GPT-4o mini: Advancing cost-efficient intelligence","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.02372","last_updated":"2026-08-03T15:15:55Z","snapshot_observed_at":"2026-08-08T16:06:41.492085Z","submitted_at":"2026-08-03T15:15:55Z","title":"PredAct-Bench: Benchmarking Tool-Augmented Dialogue under Controlled Tool Noise","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-04T08:32:46.582534Z"},"links":{"citing_paper":"/paper/2608.02372"},"observation_digest":"sha256:3029b0b556b38c6d093b88131dcaaec8a8b6970c3939275458423cb07d03f637","observation_id":"a706882c-f725-4e17-bd48-abea13598413","resolution":{"observed_at":"2026-08-04T08:32:46.582534Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T08:32:46.659446Z","title":"Introducing GPT-5.4 mini and nano","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.02372","last_updated":"2026-08-03T15:15:55Z","snapshot_observed_at":"2026-08-08T16:06:41.492085Z","submitted_at":"2026-08-03T15:15:55Z","title":"PredAct-Bench: Benchmarking Tool-Augmented Dialogue under Controlled Tool Noise","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-04T08:32:46.659446Z"},"links":{"citing_paper":"/paper/2608.02372"},"observation_digest":"sha256:7226f6d486aefdc80bf2fd3326165714d00b3fc1c7c3e3e19cbd006b4f91f675","observation_id":"72914927-0152-422b-bfff-28cb4effaeb2","resolution":{"observed_at":"2026-08-04T08:32:46.659446Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T08:32:46.815954Z","title":"GPT-5.5 System Card","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.02372","last_updated":"2026-08-03T15:15:55Z","snapshot_observed_at":"2026-08-08T16:06:41.492085Z","submitted_at":"2026-08-03T15:15:55Z","title":"PredAct-Bench: Benchmarking Tool-Augmented Dialogue under Controlled Tool Noise","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-04T08:32:46.815954Z"},"links":{"citing_paper":"/paper/2608.02372"},"observation_digest":"sha256:e2a8884ce4e6e554ae1d2cfc44d399ac14cff34b7535ecc35172d7202753377f","observation_id":"a40f4512-4bf9-4399-97a5-9c030786c193","resolution":{"observed_at":"2026-08-04T08:32:46.815954Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T08:32:46.878354Z","title":"Patil, Tianjun Zhang, Xin Wang, and Joseph E","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.02372","last_updated":"2026-08-03T15:15:55Z","snapshot_observed_at":"2026-08-08T16:06:41.492085Z","submitted_at":"2026-08-03T15:15:55Z","title":"PredAct-Bench: Benchmarking Tool-Augmented Dialogue under Controlled Tool Noise","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-04T08:32:46.878354Z"},"links":{"citing_paper":"/paper/2608.02372"},"observation_digest":"sha256:b3618b29a4d4991007030d8fb664cb172c0d477cf6c223cf10e4a6a57d78dcca","observation_id":"d3f37d3c-eed8-47bf-8043-126e87bb8ea7","resolution":{"observed_at":"2026-08-04T08:32:46.878354Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T08:32:46.926362Z","title":"Gonzalez","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.02372","last_updated":"2026-08-03T15:15:55Z","snapshot_observed_at":"2026-08-08T16:06:41.492085Z","submitted_at":"2026-08-03T15:15:55Z","title":"PredAct-Bench: Benchmarking Tool-Augmented Dialogue under Controlled Tool Noise","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-04T08:32:46.926362Z"},"links":{"citing_paper":"/paper/2608.02372"},"observation_digest":"sha256:0c1a6aef94780ad02841a33b41294fb80cbe56fccd742f1985f11029518f42a8","observation_id":"e01096d4-b7c7-4943-bd83-118cb1a920f0","resolution":{"observed_at":"2026-08-04T08:32:46.926362Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.12860","last_updated":"2024-10-11T20:55:51Z","snapshot_observed_at":"2026-07-06T19:34:46.714277Z","submitted_at":"2024-10-11T20:55:51Z","title":"LLMD: A Large Language Model for Interpreting Longitudinal Medical Records","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.12860","snapshot_observed_at":"2026-08-04T08:32:46.996990Z","title":"Llmd: A large language model for interpreting longitudinal medical records.arXiv preprint arXiv:2410.12860, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.02372","last_updated":"2026-08-03T15:15:55Z","snapshot_observed_at":"2026-08-08T16:06:41.492085Z","submitted_at":"2026-08-03T15:15:55Z","title":"PredAct-Bench: Benchmarking Tool-Augmented Dialogue under Controlled Tool Noise","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-04T08:32:46.996990Z"},"links":{"cited_paper":"/paper/2410.12860","citing_paper":"/paper/2608.02372"},"observation_digest":"sha256:0ccc9b59b21736c4fc497642d55c01ed62790d25163d90187bbf5dae6a0511a8","observation_id":"f5c0ab94-5970-4b58-ad47-ffba373e0c5e","resolution":{"observed_at":"2026-08-04T08:32:46.996990Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T08:32:47.081849Z","title":"ToolLLM: Facilitating large language models to master 16000+ real-world APIs","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.02372","last_updated":"2026-08-03T15:15:55Z","snapshot_observed_at":"2026-08-08T16:06:41.492085Z","submitted_at":"2026-08-03T15:15:55Z","title":"PredAct-Bench: Benchmarking Tool-Augmented Dialogue under Controlled Tool Noise","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-04T08:32:47.081849Z"},"links":{"citing_paper":"/paper/2608.02372"},"observation_digest":"sha256:ee4f871e065bc68d5e8557a31988c0692a092d9ee786f4bc17737a96a0add528","observation_id":"32d9be73-7da3-4619-8016-bb71a2b0e0db","resolution":{"observed_at":"2026-08-04T08:32:47.081849Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T08:32:47.213183Z","title":"Qwen3.5: Towards native multimodal agents, February 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.02372","last_updated":"2026-08-03T15:15:55Z","snapshot_observed_at":"2026-08-08T16:06:41.492085Z","submitted_at":"2026-08-03T15:15:55Z","title":"PredAct-Bench: Benchmarking Tool-Augmented Dialogue under Controlled Tool Noise","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-04T08:32:47.213183Z"},"links":{"citing_paper":"/paper/2608.02372"},"observation_digest":"sha256:5b99e115df71d7ef0e107bc67656f7e40d5d7c89613059e71d5c840461f4957e","observation_id":"c10d19e3-2d72-4e75-9188-f1ad4d526830","resolution":{"observed_at":"2026-08-04T08:32:47.213183Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T08:32:47.333976Z","title":"Towards scalable multi-domain conversational agents: The schema-guided dialogue dataset.Proceedings of the AAAI Conference on Artificial Intelligence, 34(05):8689–8696, Apr","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2608.02372","last_updated":"2026-08-03T15:15:55Z","snapshot_observed_at":"2026-08-08T16:06:41.492085Z","submitted_at":"2026-08-03T15:15:55Z","title":"PredAct-Bench: Benchmarking Tool-Augmented Dialogue under Controlled Tool Noise","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-04T08:32:47.333976Z"},"links":{"citing_paper":"/paper/2608.02372"},"observation_digest":"sha256:990704bf0bae933a13b2ace0443f617bbf029c199ca2a202315686e0b0cd81ba","observation_id":"84b448c8-e92b-47fb-af8c-57308fb56607","resolution":{"observed_at":"2026-08-04T08:32:47.333976Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T08:32:47.394889Z","title":"Appropriate reliance on ai advice: Conceptualization and the effect of explanations","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.02372","last_updated":"2026-08-03T15:15:55Z","snapshot_observed_at":"2026-08-08T16:06:41.492085Z","submitted_at":"2026-08-03T15:15:55Z","title":"PredAct-Bench: Benchmarking Tool-Augmented Dialogue under Controlled Tool Noise","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-04T08:32:47.394889Z"},"links":{"citing_paper":"/paper/2608.02372"},"observation_digest":"sha256:d1a07888ce0399a3e2f2f05f6822d880b13abab8323c0a48dbc67902650ff909","observation_id":"e40a3819-c6ba-4e12-a8cd-b8fdf4d9aa35","resolution":{"observed_at":"2026-08-04T08:32:47.394889Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T08:32:47.507523Z","title":"Timo: Towards better temporal reasoning for language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.02372","last_updated":"2026-08-03T15:15:55Z","snapshot_observed_at":"2026-08-08T16:06:41.492085Z","submitted_at":"2026-08-03T15:15:55Z","title":"PredAct-Bench: Benchmarking Tool-Augmented Dialogue under Controlled Tool Noise","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-04T08:32:47.507523Z"},"links":{"citing_paper":"/paper/2608.02372"},"observation_digest":"sha256:ba8c99854eef848a4714d2b128fad95e2abd9fd2865ee04a97b24cfe33a6b8c0","observation_id":"47de76a1-0fa2-4b7c-942f-79974f0ab4a2","resolution":{"observed_at":"2026-08-04T08:32:47.507523Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T08:32:47.600137Z","title":"Paladin: Self-correcting language model agents to cure tool-failure cases, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.02372","last_updated":"2026-08-03T15:15:55Z","snapshot_observed_at":"2026-08-08T16:06:41.492085Z","submitted_at":"2026-08-03T15:15:55Z","title":"PredAct-Bench: Benchmarking Tool-Augmented Dialogue under Controlled Tool Noise","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-04T08:32:47.600137Z"},"links":{"citing_paper":"/paper/2608.02372"},"observation_digest":"sha256:8d7d36f7eae904e6375f5d73bbde560a04f84497da06924523f8ec8adf21faff","observation_id":"89d6230b-03b7-4c1a-80fd-b2298631812a","resolution":{"observed_at":"2026-08-04T08:32:47.600137Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T08:32:47.762337Z","title":"Agentnoisebench: Benchmarking robustness of tool-using llm agents under noisy condition, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.02372","last_updated":"2026-08-03T15:15:55Z","snapshot_observed_at":"2026-08-08T16:06:41.492085Z","submitted_at":"2026-08-03T15:15:55Z","title":"PredAct-Bench: Benchmarking Tool-Augmented Dialogue under Controlled Tool Noise","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-04T08:32:47.762337Z"},"links":{"citing_paper":"/paper/2608.02372"},"observation_digest":"sha256:c2c56111595cb417279334f2ffabfeec89c6bfdffd274dce929027b1acf14afd","observation_id":"47e98ff6-7aba-4a92-b24f-eb9de741ed8f","resolution":{"observed_at":"2026-08-04T08:32:47.762337Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T08:32:47.874010Z","title":"Butterfly effects in toolchains: A comprehensive analysis of failed parameter filling in LLM tool-agent systems","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.02372","last_updated":"2026-08-03T15:15:55Z","snapshot_observed_at":"2026-08-08T16:06:41.492085Z","submitted_at":"2026-08-03T15:15:55Z","title":"PredAct-Bench: Benchmarking Tool-Augmented Dialogue under Controlled Tool Noise","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-04T08:32:47.874010Z"},"links":{"citing_paper":"/paper/2608.02372"},"observation_digest":"sha256:7c56d4047588f278dd457a4a193c653f7f7670985eb006931cd87b79f3c20157","observation_id":"b08e8d73-0612-4b52-9e9b-f23719076039","resolution":{"observed_at":"2026-08-04T08:32:47.874010Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.04141","last_updated":"2025-05-29T08:04:32Z","snapshot_observed_at":"2026-07-06T20:02:08.313625Z","submitted_at":"2024-12-05T13:10:54Z","title":"Reducing Tool Hallucination via Reliability Alignment","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.04141","snapshot_observed_at":"2026-08-04T08:32:48.011938Z","title":"Reducing tool hallucination via reliability alignment, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.02372","last_updated":"2026-08-03T15:15:55Z","snapshot_observed_at":"2026-08-08T16:06:41.492085Z","submitted_at":"2026-08-03T15:15:55Z","title":"PredAct-Bench: Benchmarking Tool-Augmented Dialogue under Controlled Tool Noise","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-04T08:32:48.011938Z"},"links":{"cited_paper":"/paper/2412.04141","citing_paper":"/paper/2608.02372"},"observation_digest":"sha256:32ea15024882e4969f88c71c2c2b0c59e0eba5cda64766c9c434d140f22563b2","observation_id":"a1028e53-6f80-4a14-af3b-5d0589a0e7ac","resolution":{"observed_at":"2026-08-04T08:32:48.011938Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.12307","last_updated":"2025-08-02T06:08:30Z","snapshot_observed_at":"2026-07-06T18:32:44.452493Z","submitted_at":"2024-06-18T06:28:06Z","title":"Can Tool-augmented Large Language Models be Aware of Incomplete Conditions?","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.12307","snapshot_observed_at":"2026-08-04T08:32:48.154098Z","title":"Can tool-augmented large language models be aware of incomplete conditions?, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.02372","last_updated":"2026-08-03T15:15:55Z","snapshot_observed_at":"2026-08-08T16:06:41.492085Z","submitted_at":"2026-08-03T15:15:55Z","title":"PredAct-Bench: Benchmarking Tool-Augmented Dialogue under Controlled Tool Noise","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-04T08:32:48.154098Z"},"links":{"cited_paper":"/paper/2406.12307","citing_paper":"/paper/2608.02372"},"observation_digest":"sha256:8c2319fc38c0c4fe72db7e607112d068395551311a02516641fecc623dd529ce","observation_id":"a016a723-7571-439b-88df-58fd08e72c43","resolution":{"observed_at":"2026-08-04T08:32:48.154098Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T08:32:48.264525Z","title":"τ-bench: A benchmark for Tool-Agent-User interaction in real-world domains","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.02372","last_updated":"2026-08-03T15:15:55Z","snapshot_observed_at":"2026-08-08T16:06:41.492085Z","submitted_at":"2026-08-03T15:15:55Z","title":"PredAct-Bench: Benchmarking Tool-Augmented Dialogue under Controlled Tool Noise","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-04T08:32:48.264525Z"},"links":{"citing_paper":"/paper/2608.02372"},"observation_digest":"sha256:8a8d0f2bf58a0276ccbbd45ef92c31e5cd855b8290a6d68623928e8b399678ff","observation_id":"44df9c9e-d438-4cc8-9a43-8a7c522550a6","resolution":{"observed_at":"2026-08-04T08:32:48.264525Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T08:32:48.388211Z","title":"MultiWOZ 2.4: A multi-domain task-oriented dialogue dataset with essential annotation corrections to improve state track- ing evaluation","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.02372","last_updated":"2026-08-03T15:15:55Z","snapshot_observed_at":"2026-08-08T16:06:41.492085Z","submitted_at":"2026-08-03T15:15:55Z","title":"PredAct-Bench: Benchmarking Tool-Augmented Dialogue under Controlled Tool Noise","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-04T08:32:48.388211Z"},"links":{"citing_paper":"/paper/2608.02372"},"observation_digest":"sha256:c956cea31252c6398691cf95a7d0bb5f62d81a1d5fe7721c3c54a375785fdd9e","observation_id":"d1d09bbd-ee5a-40d9-ade5-c71ec30779f5","resolution":{"observed_at":"2026-08-04T08:32:48.388211Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T08:32:48.511445Z","title":"MultiWOZ 2.2 : A dialogue dataset with additional annotation corrections and state tracking baselines","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2608.02372","last_updated":"2026-08-03T15:15:55Z","snapshot_observed_at":"2026-08-08T16:06:41.492085Z","submitted_at":"2026-08-03T15:15:55Z","title":"PredAct-Bench: Benchmarking Tool-Augmented Dialogue under Controlled Tool Noise","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-04T08:32:48.511445Z"},"links":{"citing_paper":"/paper/2608.02372"},"observation_digest":"sha256:be9a2ca10076aebcd107372ee3b9a61f37dc4d3bcdcac304881b1bb29398272a","observation_id":"8ff6ca94-4e10-49a4-95c4-83d46d8e6326","resolution":{"observed_at":"2026-08-04T08:32:48.511445Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T08:32:48.612316Z","title":"From allies to adversaries: Manipulating LLM tool-calling through adversarial injection","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.02372","last_updated":"2026-08-03T15:15:55Z","snapshot_observed_at":"2026-08-08T16:06:41.492085Z","submitted_at":"2026-08-03T15:15:55Z","title":"PredAct-Bench: Benchmarking Tool-Augmented Dialogue under Controlled Tool Noise","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-04T08:32:48.612316Z"},"links":{"citing_paper":"/paper/2608.02372"},"observation_digest":"sha256:2c67210360b053630db9a5091b9ec8ba1aab2850b44695de715e73610bbe27f9","observation_id":"0ee22073-1f93-49c2-bb72-19f0b9bcd373","resolution":{"observed_at":"2026-08-04T08:32:48.612316Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T08:32:48.760073Z","title":"CLAMBER: A benchmark of identifying and clarifying ambiguous information needs in large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.02372","last_updated":"2026-08-03T15:15:55Z","snapshot_observed_at":"2026-08-08T16:06:41.492085Z","submitted_at":"2026-08-03T15:15:55Z","title":"PredAct-Bench: Benchmarking Tool-Augmented Dialogue under Controlled Tool Noise","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-04T08:32:48.760073Z"},"links":{"citing_paper":"/paper/2608.02372"},"observation_digest":"sha256:50eea57a3570fbc835400d62c9a08eec7618e94f862f8abebb1cb52599bad206","observation_id":"26473219-2caa-4716-8338-478878987eef","resolution":{"observed_at":"2026-08-04T08:32:48.760073Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T08:32:48.911714Z","title":"ToolBeHonest: A multi-level hallucination diagnostic benchmark for tool-augmented large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.02372","last_updated":"2026-08-03T15:15:55Z","snapshot_observed_at":"2026-08-08T16:06:41.492085Z","submitted_at":"2026-08-03T15:15:55Z","title":"PredAct-Bench: Benchmarking Tool-Augmented Dialogue under Controlled Tool Noise","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-04T08:32:48.911714Z"},"links":{"citing_paper":"/paper/2608.02372"},"observation_digest":"sha256:31bb197860fd2b4971047e949bcc6ffae8041064a07dabeaa9b8faa29f50390a","observation_id":"b893b0a0-8e23-4c5e-b412-4f229cb1024f","resolution":{"observed_at":"2026-08-04T08:32:48.911714Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.13854","last_updated":"2024-04-16T15:13:18Z","snapshot_observed_at":"2026-08-06T12:47:01.809185Z","submitted_at":"2023-07-25T22:59:32Z","title":"WebArena: A Realistic Web Environment for Building Autonomous Agents","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.13854","snapshot_observed_at":"2026-08-04T08:32:49.005953Z","title":"primary driver","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.02372","last_updated":"2026-08-03T15:15:55Z","snapshot_observed_at":"2026-08-08T16:06:41.492085Z","submitted_at":"2026-08-03T15:15:55Z","title":"PredAct-Bench: Benchmarking Tool-Augmented Dialogue under Controlled Tool Noise","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-04T08:32:49.005953Z"},"links":{"cited_paper":"/paper/2307.13854","citing_paper":"/paper/2608.02372"},"observation_digest":"sha256:539e47ac8403e2d3e3d7055fec6037b3e1699835e9556c4cc96e88aa02c19e25","observation_id":"b7205e0c-2a3a-410a-b1b7-6f0cb03fe58f","resolution":{"observed_at":"2026-08-04T08:32:49.005953Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T08:32:49.105357Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02372","last_updated":"2026-08-03T15:15:55Z","snapshot_observed_at":"2026-08-08T16:06:41.492085Z","submitted_at":"2026-08-03T15:15:55Z","title":"PredAct-Bench: Benchmarking Tool-Augmented Dialogue under Controlled Tool Noise","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-04T08:32:49.105357Z"},"links":{"citing_paper":"/paper/2608.02372"},"observation_digest":"sha256:bc25cb860779236c672c0404b5273d4b20d45d20fc630731e32a16c6c86ac006","observation_id":"ce43522e-37e3-4a92-be93-0966cec3ac4a","resolution":{"observed_at":"2026-08-04T08:32:49.105357Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T08:32:49.193660Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02372","last_updated":"2026-08-03T15:15:55Z","snapshot_observed_at":"2026-08-08T16:06:41.492085Z","submitted_at":"2026-08-03T15:15:55Z","title":"PredAct-Bench: Benchmarking Tool-Augmented Dialogue under Controlled Tool Noise","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-04T08:32:49.193660Z"},"links":{"citing_paper":"/paper/2608.02372"},"observation_digest":"sha256:d7652bd46291bc8d65a03cb0f758d0c163e34837eea7af58f8feccc730709f72","observation_id":"101634f9-4680-4160-80c2-014b0440f502","resolution":{"observed_at":"2026-08-04T08:32:49.193660Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T08:32:49.300953Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02372","last_updated":"2026-08-03T15:15:55Z","snapshot_observed_at":"2026-08-08T16:06:41.492085Z","submitted_at":"2026-08-03T15:15:55Z","title":"PredAct-Bench: Benchmarking Tool-Augmented Dialogue under Controlled Tool Noise","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-04T08:32:49.300953Z"},"links":{"citing_paper":"/paper/2608.02372"},"observation_digest":"sha256:4343b595f6c5126320c4bbb555a0c3f5257636a244964fd3a3955635433708be","observation_id":"998d2d4c-86fd-4029-90a9-bc50bc628c88","resolution":{"observed_at":"2026-08-04T08:32:49.300953Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T08:32:49.405786Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02372","last_updated":"2026-08-03T15:15:55Z","snapshot_observed_at":"2026-08-08T16:06:41.492085Z","submitted_at":"2026-08-03T15:15:55Z","title":"PredAct-Bench: Benchmarking Tool-Augmented Dialogue under Controlled Tool Noise","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-04T08:32:49.405786Z"},"links":{"citing_paper":"/paper/2608.02372"},"observation_digest":"sha256:a28bbc43c79c0cdd2b5c7ffcae602792f63fda2fa2e61bd92fd4884222d04d24","observation_id":"3363725e-05f2-415f-aa54-fe35f671204a","resolution":{"observed_at":"2026-08-04T08:32:49.405786Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T08:32:49.476122Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02372","last_updated":"2026-08-03T15:15:55Z","snapshot_observed_at":"2026-08-08T16:06:41.492085Z","submitted_at":"2026-08-03T15:15:55Z","title":"PredAct-Bench: Benchmarking Tool-Augmented Dialogue under Controlled Tool Noise","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-04T08:32:49.476122Z"},"links":{"citing_paper":"/paper/2608.02372"},"observation_digest":"sha256:e2f15b1663920253d4e766d95b9dd7dc33bfcfbb50291f6e4f40bc7f8184944f","observation_id":"69870187-8700-4e82-b1ee-fbb3c57269df","resolution":{"observed_at":"2026-08-04T08:32:49.476122Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T08:32:49.575837Z","title":"Failure Risk: Critical","venue":null,"work_id":null,"year":2047},"citing_paper":{"arxiv_id":"2608.02372","last_updated":"2026-08-03T15:15:55Z","snapshot_observed_at":"2026-08-08T16:06:41.492085Z","submitted_at":"2026-08-03T15:15:55Z","title":"PredAct-Bench: Benchmarking Tool-Augmented Dialogue under Controlled Tool Noise","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-04T08:32:49.575837Z"},"links":{"citing_paper":"/paper/2608.02372"},"observation_digest":"sha256:8e5526c6b6417ec012d97d280a95c42d979b0ecfdc060715effba833be71be86","observation_id":"e5e5948d-c24b-4d20-a769-f1996a9946d4","resolution":{"observed_at":"2026-08-04T08:32:49.575837Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2608.02372","last_updated":"2026-08-03T15:15:55Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-08T16:06:41.492085Z","submitted_at":"2026-08-03T15:15:55Z","title":"PredAct-Bench: Benchmarking Tool-Augmented Dialogue under Controlled Tool Noise"},"reference_resolution":{"displayed":53,"state_counts":{"malformed_identifier":4,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":48,"verified_exact":1,"verified_fuzzy":0},"total_outbound_references":53},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 53 of 53 outbound references and 0 inbound Pith citation observations for arXiv:2608.02372."}