{"as_of":"2026-08-06T05:50:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:d67b2851aab299b487a891903d177c38f9695f4294811de3e0818eb8af567b22","coverage":[{"denominator":32,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":32,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-10T08:00:45.789649Z","state":"measured"},{"denominator":36,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":36,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-05T06:32:48.257954+00:00","state":"measured"},{"denominator":4,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":4,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T04:16:25.386254Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-05T04:18:58.494760Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2604.16706","last_updated":"2026-04-17T21:15:35Z","snapshot_observed_at":"2026-07-06T23:03:57.199731Z","submitted_at":"2026-04-17T21:15:35Z","title":"Evaluating Tool-Using Language Agents: Judge Reliability, Propagation Cascades, and Runtime Mitigation in AgentProp-Bench","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.16706","snapshot_observed_at":"2026-07-14T07:06:37.817238Z","title":"arXiv preprint arXiv:2604.16706 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.11098","last_updated":"2026-07-15T06:22:24Z","snapshot_observed_at":"2026-08-02T22:55:59.756547Z","submitted_at":"2026-07-13T05:14:12Z","title":"AgentCheck: A Reproduce-Intervene-Mitigate Workbench for LLM Agents over MCP","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-07-14T07:06:37.817238Z"},"links":{"cited_paper":"/paper/2604.16706","citing_paper":"/paper/2607.11098"},"observation_digest":"sha256:8761939c580f94fc9554b6728b61872b3d3c3b64679a4aa164dbfedbe924e036","observation_id":"33f66bf7-ec2b-46af-b59e-761d2af92727","resolution":{"observed_at":"2026-07-14T07:06:37.817238Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.16706","last_updated":"2026-04-17T21:15:35Z","snapshot_observed_at":"2026-07-06T23:03:57.199731Z","submitted_at":"2026-04-17T21:15:35Z","title":"Evaluating Tool-Using Language Agents: Judge Reliability, Propagation Cascades, and Runtime Mitigation in AgentProp-Bench","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.16706","snapshot_observed_at":"2026-08-02T07:04:24.398577Z","title":"arXiv preprint arXiv:2604.16706 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.11098","last_updated":"2026-07-15T06:22:24Z","snapshot_observed_at":"2026-08-02T22:55:59.756547Z","submitted_at":"2026-07-13T05:14:12Z","title":"AgentCheck: A Reproduce-Intervene-Mitigate Workbench for LLM Agents over MCP","version":3},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-02T07:04:24.398577Z"},"links":{"cited_paper":"/paper/2604.16706","citing_paper":"/paper/2607.11098"},"observation_digest":"sha256:ef392bb38ec83649979728614aee58de4250d8e20c8a3156b07d90ba547510a8","observation_id":"b504a754-8419-45f3-a8c2-f4915f885fee","resolution":{"observed_at":"2026-08-02T07:04:24.398577Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.16706","last_updated":"2026-04-17T21:15:35Z","snapshot_observed_at":"2026-07-06T23:03:57.199731Z","submitted_at":"2026-04-17T21:15:35Z","title":"Evaluating Tool-Using Language Agents: Judge Reliability, Propagation Cascades, and Runtime Mitigation in AgentProp-Bench","version":1},"cited_work":{"arxiv_id":"2604.16706","doi":null,"metadata_source":"pith","pith_arxiv_id":"2604.16706","snapshot_observed_at":"2026-08-05T04:18:58.494760Z","title":"Evaluating Tool-Using Language Agents: Judge Reliability, Propagation Cascades, and Runtime Mitigation in AgentProp-Bench","venue":"cs.AI","work_id":"2c4cdd5c-4b34-44a1-abe0-27863b587144","year":2026},"citing_paper":{"arxiv_id":"2608.00794","last_updated":"2026-08-05T05:37:25Z","snapshot_observed_at":"2026-08-06T05:50:00.366210Z","submitted_at":"2026-08-01T17:50:12Z","title":"Measurement Without Validity: The Compounding Reliability Problem in Agentic AI Evaluation","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-05T04:18:52.865771Z"},"links":{"cited_paper":"/paper/2604.16706","citing_paper":"/paper/2608.00794"},"observation_digest":"sha256:f7d33e2e7fb6de8952da2e7723dd44ffa7c70f434e6395fb492382d765d8dd1d","observation_id":"6aa18014-c06c-4dd2-88ea-ea98b63070b6","resolution":{"observed_at":"2026-08-05T04:18:58.706418Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2604.16706","last_updated":"2026-04-17T21:15:35Z","snapshot_observed_at":"2026-07-06T23:03:57.199731Z","submitted_at":"2026-04-17T21:15:35Z","title":"Evaluating Tool-Using Language Agents: Judge Reliability, Propagation Cascades, and Runtime Mitigation in AgentProp-Bench","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.16706","snapshot_observed_at":"2026-08-06T04:16:25.386254Z","title":"Gurram, Evaluating tool-using language agents: Judge reliability, propagation cascades, and runtime mitigation in AgentProp-Bench, arXiv preprint arXiv:2604.16706, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.00794","last_updated":"2026-08-05T05:37:25Z","snapshot_observed_at":"2026-08-06T05:50:00.366210Z","submitted_at":"2026-08-01T17:50:12Z","title":"Measurement Without Validity: The Compounding Reliability Problem in Agentic AI Evaluation","version":3},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T04:16:25.386254Z"},"links":{"cited_paper":"/paper/2604.16706","citing_paper":"/paper/2608.00794"},"observation_digest":"sha256:8e0a69225eb95316835f998a9a1d6033d18cc759459214e387bbae850b1e5030","observation_id":"134321c2-74c8-4d7a-89b4-9c83fc9ef6f9","resolution":{"observed_at":"2026-08-06T04:16:25.386254Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2604.16706/citation-record","integrity":"/paper/2604.16706/integrity","json":"/paper/2604.16706/citation-record.json","paper":"/paper/2604.16706"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"3791.369841","doi":"10.1145/3673791.3698410","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Krisztian Balog, Donald Metzler, and Zhen Qin","venue":null,"work_id":"963d5b72-bb86-4a9b-83c2-ef7524ee7954","year":2024},"citing_paper":{"arxiv_id":"2604.16706","last_updated":"2026-04-17T21:15:35Z","snapshot_observed_at":"2026-07-06T23:03:57.199731Z","submitted_at":"2026-04-17T21:15:35Z","title":"Evaluating Tool-Using Language Agents: Judge Reliability, Propagation Cascades, and Runtime Mitigation in AgentProp-Bench","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-10T08:00:45.789649Z"},"links":{"citing_paper":"/paper/2604.16706"},"observation_digest":"sha256:ecedb743656c09a266dc5c9f690b203a5c4a1fc573c925ed154305b89971257a","observation_id":"b93512f3-f6a7-4429-96fc-8429d87f3c1f","resolution":{"observed_at":"2026-05-10T08:02:24.369234Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.19092","last_updated":"2025-07-09T22:09:49Z","snapshot_observed_at":"2026-08-05T00:55:27.813739Z","submitted_at":"2025-03-24T19:24:40Z","title":"Rankers, Judges, and Assistants: Towards Understanding the Interplay of LLMs in Information Retrieval Evaluation","version":2},"cited_work":{"arxiv_id":"2503.19092","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.19092","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Rankers, judges, and assis- tants: Towards understanding the interplay of llms in information retrieval evaluation","venue":null,"work_id":"8ec596f8-d04b-435f-ad7c-88158bc3fd05","year":2025},"citing_paper":{"arxiv_id":"2604.16706","last_updated":"2026-04-17T21:15:35Z","snapshot_observed_at":"2026-07-06T23:03:57.199731Z","submitted_at":"2026-04-17T21:15:35Z","title":"Evaluating Tool-Using Language Agents: Judge Reliability, Propagation Cascades, and Runtime Mitigation in AgentProp-Bench","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-10T08:00:45.789649Z"},"links":{"cited_paper":"/paper/2503.19092","citing_paper":"/paper/2604.16706"},"observation_digest":"sha256:402132f0d8a8567908e017bc1f61c0a37c5ca638e45ad403a719b71ea673f02c","observation_id":"a4f6cfe1-bb76-4158-a342-97083b4e70f5","resolution":{"observed_at":"2026-05-10T08:02:24.979582Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.07982","last_updated":"2025-06-09T17:52:18Z","snapshot_observed_at":"2026-07-06T21:39:13.304260Z","submitted_at":"2025-06-09T17:52:18Z","title":"$\\tau^2$-Bench: Evaluating Conversational Agents in a Dual-Control Environment","version":1},"cited_work":{"arxiv_id":"2506.07982","doi":"10.48550/arxiv.2506.07982","metadata_source":"pith","pith_arxiv_id":"2506.07982","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"$\\tau^2$-Bench: Evaluating Conversational Agents in a Dual-Control Environment","venue":"cs.AI","work_id":"3a498b1a-455f-4667-b572-c5216c99a89c","year":2025},"citing_paper":{"arxiv_id":"2604.16706","last_updated":"2026-04-17T21:15:35Z","snapshot_observed_at":"2026-07-06T23:03:57.199731Z","submitted_at":"2026-04-17T21:15:35Z","title":"Evaluating Tool-Using Language Agents: Judge Reliability, Propagation Cascades, and Runtime Mitigation in AgentProp-Bench","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-10T08:00:45.789649Z"},"links":{"cited_paper":"/paper/2506.07982","citing_paper":"/paper/2604.16706"},"observation_digest":"sha256:c8b114c1a38691b1980505aadb6c0c7ff0520f02ed2bf6bb2acc91390daeceab","observation_id":"c0443dad-030b-4911-9d9f-52715a0643d6","resolution":{"observed_at":"2026-05-12T07:52:17.902869Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-14T18:20:22.129969+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-14T18:20:22.129969+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.18403","last_updated":"2025-06-02T11:31:19Z","snapshot_observed_at":"2026-07-06T18:37:21.973331Z","submitted_at":"2024-06-26T14:56:13Z","title":"LLMs instead of Human Judges? A Large Scale Empirical Study across 20 NLP Evaluation Tasks","version":3},"cited_work":{"arxiv_id":"2406.18403","doi":"10.48550/arxiv.2406.18403","metadata_source":"arxiv_reference","pith_arxiv_id":"2406.18403","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"arXiv preprint (2025), https://arxiv.org/abs/ 2406.18403","venue":null,"work_id":"5ea289bf-9578-446a-a0be-2f8aa10813e0","year":2025},"citing_paper":{"arxiv_id":"2604.16706","last_updated":"2026-04-17T21:15:35Z","snapshot_observed_at":"2026-07-06T23:03:57.199731Z","submitted_at":"2026-04-17T21:15:35Z","title":"Evaluating Tool-Using Language Agents: Judge Reliability, Propagation Cascades, and Runtime Mitigation in AgentProp-Bench","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-10T08:00:45.789649Z"},"links":{"cited_paper":"/paper/2406.18403","citing_paper":"/paper/2604.16706"},"observation_digest":"sha256:ce3b8d23ac275a9baf5e30000e198b7f13360db9fcc93106b4c590f142c68814","observation_id":"894f4d4a-d92d-4f67-8db3-f8d7c631899c","resolution":{"observed_at":"2026-05-10T08:02:24.964601Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1177/001316446002000104","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T13:57:06.823828Z","title":"A coefficient of agreement for nominal scales.Educational and Psychological Measurement, 20(1):37–46","venue":"Educational and Psychological Measurement","work_id":"acc7eb00-fd37-4883-9f25-f4e7057b60f0","year":1960},"citing_paper":{"arxiv_id":"2604.16706","last_updated":"2026-04-17T21:15:35Z","snapshot_observed_at":"2026-07-06T23:03:57.199731Z","submitted_at":"2026-04-17T21:15:35Z","title":"Evaluating Tool-Using Language Agents: Judge Reliability, Propagation Cascades, and Runtime Mitigation in AgentProp-Bench","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-10T08:00:45.789649Z"},"links":{"citing_paper":"/paper/2604.16706"},"observation_digest":"sha256:f59a0c4ac5168d47c0515b96df40e7ce8d3f2add1f4354b9698110957811bc5a","observation_id":"1982637d-2fad-4555-9868-189c85bf8fb4","resolution":{"observed_at":"2026-05-10T08:02:24.365360Z","resolver_source":"doi","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-01T07:38:14.800511+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-01T07:38:14.800511+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.15217","last_updated":"2025-04-28T05:09:12Z","snapshot_observed_at":"2026-08-05T02:02:34.574070Z","submitted_at":"2023-09-26T19:23:54Z","title":"Ragas: Automated Evaluation of Retrieval Augmented Generation","version":2},"cited_work":{"arxiv_id":"2309.15217","doi":"10.48550/arxiv.2309.15217","metadata_source":"pith","pith_arxiv_id":"2309.15217","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Ragas: Automated Evaluation of Retrieval Augmented Generation","venue":"cs.CL","work_id":"1820f37c-e2c1-4f5c-81b1-3b81aa324cab","year":2023},"citing_paper":{"arxiv_id":"2604.16706","last_updated":"2026-04-17T21:15:35Z","snapshot_observed_at":"2026-07-06T23:03:57.199731Z","submitted_at":"2026-04-17T21:15:35Z","title":"Evaluating Tool-Using Language Agents: Judge Reliability, Propagation Cascades, and Runtime Mitigation in AgentProp-Bench","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-10T08:00:45.789649Z"},"links":{"cited_paper":"/paper/2309.15217","citing_paper":"/paper/2604.16706"},"observation_digest":"sha256:01f5bd0bd57ac35e3ff90f1ed3fd4684321e479a2021ba6b49ac276601a801b5","observation_id":"347df548-b830-467d-aa4e-2a4d1785a44d","resolution":{"observed_at":"2026-05-16T21:37:40.926471Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1038/s41586-024-07421-0","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T03:37:44.753801Z","title":"Farquhar, J","venue":"Nature","work_id":"01db46ad-1693-4ad4-96c9-8f4620693f17","year":2024},"citing_paper":{"arxiv_id":"2604.16706","last_updated":"2026-04-17T21:15:35Z","snapshot_observed_at":"2026-07-06T23:03:57.199731Z","submitted_at":"2026-04-17T21:15:35Z","title":"Evaluating Tool-Using Language Agents: Judge Reliability, Propagation Cascades, and Runtime Mitigation in AgentProp-Bench","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-10T08:00:45.789649Z"},"links":{"citing_paper":"/paper/2604.16706"},"observation_digest":"sha256:c6369746c5443f8e67ccd84457997a81ffeb18d4c42833e50c70ea13fee9132e","observation_id":"722986dc-69df-4417-9c05-8f4d29ab3bb6","resolution":{"observed_at":"2026-05-10T08:02:24.374673Z","resolver_source":"doi","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-11T12:19:07.31045+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T12:19:07.31045+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2505.12434","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T17:40:00.905697Z","title":"Videorft: Incentivizing video reasoning capability in mllms via reinforced fine-tuning","venue":null,"work_id":"89c249fe-60da-4724-bb0c-770442676a88","year":2025},"citing_paper":{"arxiv_id":"2604.16706","last_updated":"2026-04-17T21:15:35Z","snapshot_observed_at":"2026-07-06T23:03:57.199731Z","submitted_at":"2026-04-17T21:15:35Z","title":"Evaluating Tool-Using Language Agents: Judge Reliability, Propagation Cascades, and Runtime Mitigation in AgentProp-Bench","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-10T08:00:45.789649Z"},"links":{"citing_paper":"/paper/2604.16706"},"observation_digest":"sha256:c00c94c7a600808e9b9e8899c968fe1047f420a1186545fd8fae63e37435441b","observation_id":"e19a740d-89fd-4719-92c4-033f2953b5be","resolution":{"observed_at":"2026-05-10T08:02:24.969672Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.15594","last_updated":"2025-10-19T10:32:43Z","snapshot_observed_at":"2026-08-02T10:23:50.881300Z","submitted_at":"2024-11-23T16:03:35Z","title":"A Survey on LLM-as-a-Judge","version":6},"cited_work":{"arxiv_id":"2411.15594","doi":"10.1016/j.xinn.2025.101253","metadata_source":"pith","pith_arxiv_id":"2411.15594","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"A Survey on LLM-as-a-Judge","venue":"cs.CL","work_id":"2676656a-67bd-4ad5-bad6-cb6f5fcdbfbe","year":2024},"citing_paper":{"arxiv_id":"2604.16706","last_updated":"2026-04-17T21:15:35Z","snapshot_observed_at":"2026-07-06T23:03:57.199731Z","submitted_at":"2026-04-17T21:15:35Z","title":"Evaluating Tool-Using Language Agents: Judge Reliability, Propagation Cascades, and Runtime Mitigation in AgentProp-Bench","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-10T08:00:45.789649Z"},"links":{"cited_paper":"/paper/2411.15594","citing_paper":"/paper/2604.16706"},"observation_digest":"sha256:fc4719fef49bd6b2deeaa4dc51774ca1527efe7a1991109365ce0eab2ebbc57c","observation_id":"96d1e742-97c9-4f62-8017-650134e2715c","resolution":{"observed_at":"2026-05-10T08:02:24.959501Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-10T18:20:01.818871+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T18:20:01.818871+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.05232","last_updated":"2024-11-19T12:42:45Z","snapshot_observed_at":"2026-07-06T16:45:07.733095Z","submitted_at":"2023-11-09T09:25:37Z","title":"A Survey on Hallucination in Large Language Models: Principles, Taxonomy, Challenges, and Open Questions","version":2},"cited_work":{"arxiv_id":"2311.05232","doi":"10.48550/arxiv.2311.05232","metadata_source":"pith","pith_arxiv_id":"2311.05232","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"A Survey on Hallucination in Large Language Models: Principles, Taxonomy, Challenges, and Open Questions","venue":"cs.CL","work_id":"6389ea5a-8e37-498f-9bb2-a238ae4b3b9d","year":2023},"citing_paper":{"arxiv_id":"2604.16706","last_updated":"2026-04-17T21:15:35Z","snapshot_observed_at":"2026-07-06T23:03:57.199731Z","submitted_at":"2026-04-17T21:15:35Z","title":"Evaluating Tool-Using Language Agents: Judge Reliability, Propagation Cascades, and Runtime Mitigation in AgentProp-Bench","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-10T08:00:45.789649Z"},"links":{"cited_paper":"/paper/2311.05232","citing_paper":"/paper/2604.16706"},"observation_digest":"sha256:0a5f0a4471ef6476e64bff4efc0d93e62bf9c1d78afd8907f7de45c8c6285d88","observation_id":"03c46076-2444-48de-b579-f21a78039509","resolution":{"observed_at":"2026-05-13T02:46:27.888032Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-04T01:08:06.736062+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-04T01:08:06.736062+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.2307/2529310","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Richard Landis and Gary G","venue":"Biometrics","work_id":"30e005db-280a-4cd9-a480-53e42284c29e","year":1977},"citing_paper":{"arxiv_id":"2604.16706","last_updated":"2026-04-17T21:15:35Z","snapshot_observed_at":"2026-07-06T23:03:57.199731Z","submitted_at":"2026-04-17T21:15:35Z","title":"Evaluating Tool-Using Language Agents: Judge Reliability, Propagation Cascades, and Runtime Mitigation in AgentProp-Bench","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-10T08:00:45.789649Z"},"links":{"citing_paper":"/paper/2604.16706"},"observation_digest":"sha256:e47b131f5a44a5603aa89187051b31ed559d35c2d87fced505c5485ac91110e7","observation_id":"d5830afb-2fe5-4599-9684-bf9b972c93f5","resolution":{"observed_at":"2026-05-10T08:02:24.371924Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-09T07:49:08.045384+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T07:49:08.045384+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2509.18970","doi":"10.48550/arxiv.2509.18970","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"LLM-based agents suffer from hallucinations: A survey of taxonomy, methods, and directions","venue":"ArXiv.org","work_id":"78f61cb8-1c72-482c-9dd4-661168d02652","year":2025},"citing_paper":{"arxiv_id":"2604.16706","last_updated":"2026-04-17T21:15:35Z","snapshot_observed_at":"2026-07-06T23:03:57.199731Z","submitted_at":"2026-04-17T21:15:35Z","title":"Evaluating Tool-Using Language Agents: Judge Reliability, Propagation Cascades, and Runtime Mitigation in AgentProp-Bench","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-10T08:00:45.789649Z"},"links":{"citing_paper":"/paper/2604.16706"},"observation_digest":"sha256:544eec23c56cd13429006dabc7942365fd73d69de3355c7d89facbfe854f83fe","observation_id":"4bb8cc40-d144-4315-b4cd-0bd193dcff07","resolution":{"observed_at":"2026-05-10T08:02:24.977159Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.03688","last_updated":"2025-10-04T03:54:18Z","snapshot_observed_at":"2026-08-04T04:48:34.061129Z","submitted_at":"2023-08-07T16:08:11Z","title":"AgentBench: Evaluating LLMs as Agents","version":3},"cited_work":{"arxiv_id":"2308.03688","doi":"10.1109/fllm63129.2024.10852426","metadata_source":"pith","pith_arxiv_id":"2308.03688","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"AgentBench: Evaluating LLMs as Agents","venue":"cs.AI","work_id":"a37549b4-4c94-412d-acc4-4efeb08509be","year":2023},"citing_paper":{"arxiv_id":"2604.16706","last_updated":"2026-04-17T21:15:35Z","snapshot_observed_at":"2026-07-06T23:03:57.199731Z","submitted_at":"2026-04-17T21:15:35Z","title":"Evaluating Tool-Using Language Agents: Judge Reliability, Propagation Cascades, and Runtime Mitigation in AgentProp-Bench","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-10T08:00:45.789649Z"},"links":{"cited_paper":"/paper/2308.03688","citing_paper":"/paper/2604.16706"},"observation_digest":"sha256:e7a4003b3fb4fd8bb1829345cabf1519d17d9ddecd246c6148e96715e263068d","observation_id":"747a18a9-7c70-4bdd-8932-3306f4902bb9","resolution":{"observed_at":"2026-05-11T11:40:05.312349Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2601.06818","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T06:59:37.220284Z","title":"AgentHallu: Benchmarking automated hallucination attribution of LLM-based agents","venue":null,"work_id":"75b5d129-5730-473e-a3b0-1f3b00f0eecb","year":2026},"citing_paper":{"arxiv_id":"2604.16706","last_updated":"2026-04-17T21:15:35Z","snapshot_observed_at":"2026-07-06T23:03:57.199731Z","submitted_at":"2026-04-17T21:15:35Z","title":"Evaluating Tool-Using Language Agents: Judge Reliability, Propagation Cascades, and Runtime Mitigation in AgentProp-Bench","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-10T08:00:45.789649Z"},"links":{"citing_paper":"/paper/2604.16706"},"observation_digest":"sha256:fe837d46a17062de0dc1ba78f453a8359ad1fa165812f5f1db73403486a37a7c","observation_id":"e9f13570-68cd-49f0-851e-225019763238","resolution":{"observed_at":"2026-05-10T08:02:24.987100Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08896","last_updated":"2023-10-11T17:43:28Z","snapshot_observed_at":"2026-07-06T15:03:55.982628Z","submitted_at":"2023-03-15T19:31:21Z","title":"SelfCheckGPT: Zero-Resource Black-Box Hallucination Detection for Generative Large Language Models","version":3},"cited_work":{"arxiv_id":"2303.08896","doi":"10.48550/arxiv.2303.08896","metadata_source":"pith","pith_arxiv_id":"2303.08896","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"SelfCheckGPT: Zero-Resource Black-Box Hallucination Detection for Generative Large Language Models","venue":"cs.CL","work_id":"90efebf6-4006-4176-9bf1-21a876571751","year":2023},"citing_paper":{"arxiv_id":"2604.16706","last_updated":"2026-04-17T21:15:35Z","snapshot_observed_at":"2026-07-06T23:03:57.199731Z","submitted_at":"2026-04-17T21:15:35Z","title":"Evaluating Tool-Using Language Agents: Judge Reliability, Propagation Cascades, and Runtime Mitigation in AgentProp-Bench","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-10T08:00:45.789649Z"},"links":{"cited_paper":"/paper/2303.08896","citing_paper":"/paper/2604.16706"},"observation_digest":"sha256:2084400cb579b8007f5dc806f9aa20a25b965ea68bd51b146fc16c383db03d3e","observation_id":"ce27df5c-9ea0-4776-841a-729af5d0bf7a","resolution":{"observed_at":"2026-05-15T15:11:22.649439Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2512.24565","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-03T17:38:43.976743Z","title":"Ziyang Luo, Zhiqi Shen, Wenzhuo Yang, Zirui Zhao, Prathyusha Jwalapuram, Amrita Saha, Doyen Sahoo, Silvio Savarese, Caiming Xiong, and Junnan Li","venue":null,"work_id":"5a6e4a9c-6bec-41d4-b62b-2ce3183a8579","year":2025},"citing_paper":{"arxiv_id":"2604.16706","last_updated":"2026-04-17T21:15:35Z","snapshot_observed_at":"2026-07-06T23:03:57.199731Z","submitted_at":"2026-04-17T21:15:35Z","title":"Evaluating Tool-Using Language Agents: Judge Reliability, Propagation Cascades, and Runtime Mitigation in AgentProp-Bench","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-10T08:00:45.789649Z"},"links":{"citing_paper":"/paper/2604.16706"},"observation_digest":"sha256:6a54417fc545616ac990fa293f5db11f54612f8ad3e42c1b81191b1ac74e2e19","observation_id":"7c9cb805-072f-4416-b1a3-8c3a330cc5b5","resolution":{"observed_at":"2026-05-10T08:02:24.972157Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.00396","last_updated":"2024-05-17T06:29:31Z","snapshot_observed_at":"2026-07-06T17:10:16.873073Z","submitted_at":"2023-12-31T04:43:45Z","title":"RAGTruth: A Hallucination Corpus for Developing Trustworthy Retrieval-Augmented Language Models","version":2},"cited_work":{"arxiv_id":"2401.00396","doi":"10.48550/arxiv.2401.00396","metadata_source":"arxiv_reference","pith_arxiv_id":"2401.00396","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Hadas Orgad, Michael Toker, Zorik Gekhman, Roi Re- ichart, Idan Szpektor, Hadas Kotek, and Yonatan Belinkov","venue":"arXiv (Cornell University)","work_id":"c6c38c54-f8d2-4e9e-b93c-c2d53621a6d7","year":2023},"citing_paper":{"arxiv_id":"2604.16706","last_updated":"2026-04-17T21:15:35Z","snapshot_observed_at":"2026-07-06T23:03:57.199731Z","submitted_at":"2026-04-17T21:15:35Z","title":"Evaluating Tool-Using Language Agents: Judge Reliability, Propagation Cascades, and Runtime Mitigation in AgentProp-Bench","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-10T08:00:45.789649Z"},"links":{"cited_paper":"/paper/2401.00396","citing_paper":"/paper/2604.16706"},"observation_digest":"sha256:76f2d3338f3cf28a633fdca6e385a9f77d0e6bfb15d8be86ee1c3b0c168e9fac","observation_id":"01c3f8a3-5262-4b46-abde-c66aaaf1f6b1","resolution":{"observed_at":"2026-05-10T08:02:24.962158Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"6772.365794","doi":"10.1145/3626772.3657942","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"In: Yang, G.H., Wang, H., Han, S., Hauff, C., Zuccon, G., Zhang, Y","venue":null,"work_id":"ee659b54-d1fd-41ae-a932-c76f02f455b5","year":2024},"citing_paper":{"arxiv_id":"2604.16706","last_updated":"2026-04-17T21:15:35Z","snapshot_observed_at":"2026-07-06T23:03:57.199731Z","submitted_at":"2026-04-17T21:15:35Z","title":"Evaluating Tool-Using Language Agents: Judge Reliability, Propagation Cascades, and Runtime Mitigation in AgentProp-Bench","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-10T08:00:45.789649Z"},"links":{"citing_paper":"/paper/2604.16706"},"observation_digest":"sha256:c30db00ac42ed54ed11e8b3b0c0728c21a119252f11c29988349d23f8553ce61","observation_id":"f92234bf-83be-4c8a-a91d-296d73f7f277","resolution":{"observed_at":"2026-05-10T08:02:24.354859Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"6772.365795","doi":"10.1145/3626772.3657951","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Proceedings of the 47th International ACM SIGIR Conference on Research and Development in Information Retrieval , pages =","venue":null,"work_id":"bcb88936-c10a-4b7d-b1e3-d23204299406","year":2024},"citing_paper":{"arxiv_id":"2604.16706","last_updated":"2026-04-17T21:15:35Z","snapshot_observed_at":"2026-07-06T23:03:57.199731Z","submitted_at":"2026-04-17T21:15:35Z","title":"Evaluating Tool-Using Language Agents: Judge Reliability, Propagation Cascades, and Runtime Mitigation in AgentProp-Bench","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-10T08:00:45.789649Z"},"links":{"citing_paper":"/paper/2604.16706"},"observation_digest":"sha256:28b5993f93de682651caaea5b752c84dfdc6e92871e5280590a2f863e927c3a6","observation_id":"911c8154-7ed0-4cb5-ae30-e7a78005e804","resolution":{"observed_at":"2026-05-10T08:02:24.347506Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.12509","last_updated":"2025-02-18T15:24:25Z","snapshot_observed_at":"2026-08-01T23:28:04.240794Z","submitted_at":"2024-12-17T03:37:31Z","title":"Can You Trust LLM Judgments? Reliability of LLM-as-a-Judge","version":2},"cited_work":{"arxiv_id":"2412.12509","doi":"10.48550/arxiv.2412.12509","metadata_source":"arxiv_reference","pith_arxiv_id":"2412.12509","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Can you trust llm judgments? reliability of llm-as- a-judge","venue":"arXiv (Cornell University)","work_id":"fbc020bc-197e-43ce-92fd-3dca29743d27","year":2024},"citing_paper":{"arxiv_id":"2604.16706","last_updated":"2026-04-17T21:15:35Z","snapshot_observed_at":"2026-07-06T23:03:57.199731Z","submitted_at":"2026-04-17T21:15:35Z","title":"Evaluating Tool-Using Language Agents: Judge Reliability, Propagation Cascades, and Runtime Mitigation in AgentProp-Bench","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-10T08:00:45.789649Z"},"links":{"cited_paper":"/paper/2412.12509","citing_paper":"/paper/2604.16706"},"observation_digest":"sha256:0152f3040d2d8b2f1273b909ffa451caf88b7f905b115ab5f4b0dc64e04fbeb9","observation_id":"a506623b-98f4-4159-9a21-1e3775c73ae6","resolution":{"observed_at":"2026-05-10T08:02:24.999729Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.15133","last_updated":"2025-03-26T13:08:41Z","snapshot_observed_at":"2026-07-06T19:20:32.349889Z","submitted_at":"2024-09-23T15:38:12Z","title":"Don't Use LLMs to Make Relevance Judgments","version":2},"cited_work":{"arxiv_id":"2409.15133","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2409.15133","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"arXiv:2409.15133","venue":null,"work_id":"548bccb0-f480-458b-af6b-cf1c78e54eed","year":2024},"citing_paper":{"arxiv_id":"2604.16706","last_updated":"2026-04-17T21:15:35Z","snapshot_observed_at":"2026-07-06T23:03:57.199731Z","submitted_at":"2026-04-17T21:15:35Z","title":"Evaluating Tool-Using Language Agents: Judge Reliability, Propagation Cascades, and Runtime Mitigation in AgentProp-Bench","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-10T08:00:45.789649Z"},"links":{"cited_paper":"/paper/2409.15133","citing_paper":"/paper/2604.16706"},"observation_digest":"sha256:7c9ccfe36a07301460d080d64eee2c03b5df2906797f317cb55b3415a62e1a54","observation_id":"d962f3e3-e2d6-43fc-bc9d-f23beb0206c7","resolution":{"observed_at":"2026-05-10T08:02:24.994461Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.12624","last_updated":"2025-08-18T00:07:23Z","snapshot_observed_at":"2026-08-01T14:58:17.402553Z","submitted_at":"2024-06-18T13:49:54Z","title":"Judging the Judges: Evaluating Alignment and Vulnerabilities in LLMs-as-Judges","version":6},"cited_work":{"arxiv_id":"2406.12624","doi":"10.48550/arxiv.2406.12624","metadata_source":"arxiv_reference","pith_arxiv_id":"2406.12624","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Judging the judges: Evaluating alignment and vulner- abilities in llms-as-judges","venue":"arXiv (Cornell University)","work_id":"d0e0145b-d0f4-43ff-8b70-fee617aaf5c5","year":2025},"citing_paper":{"arxiv_id":"2604.16706","last_updated":"2026-04-17T21:15:35Z","snapshot_observed_at":"2026-07-06T23:03:57.199731Z","submitted_at":"2026-04-17T21:15:35Z","title":"Evaluating Tool-Using Language Agents: Judge Reliability, Propagation Cascades, and Runtime Mitigation in AgentProp-Bench","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-10T08:00:45.789649Z"},"links":{"cited_paper":"/paper/2406.12624","citing_paper":"/paper/2604.16706"},"observation_digest":"sha256:09146a18c4a7c42a597acc4b1430819fb49ad56671ab3c6a5950879fdc2b63d1","observation_id":"98a09ffe-cc34-4299-8b87-cb3e37423673","resolution":{"observed_at":"2026-05-10T08:02:25.009796Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"6772.365770","doi":"10.1145/3626772.3657704","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"ISBN 9798400704314","venue":null,"work_id":"f5de09b2-7a52-4bc0-8246-44cab83b66eb","year":2024},"citing_paper":{"arxiv_id":"2604.16706","last_updated":"2026-04-17T21:15:35Z","snapshot_observed_at":"2026-07-06T23:03:57.199731Z","submitted_at":"2026-04-17T21:15:35Z","title":"Evaluating Tool-Using Language Agents: Judge Reliability, Propagation Cascades, and Runtime Mitigation in AgentProp-Bench","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-10T08:00:45.789649Z"},"links":{"citing_paper":"/paper/2604.16706"},"observation_digest":"sha256:6b35738acf1aa222d1ea331d97d280d74290ef5269589d24174d07a669d2d837","observation_id":"2cb13816-cab7-41f7-a857-1fdd14102449","resolution":{"observed_at":"2026-05-10T08:02:24.358733Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.18666","last_updated":"2025-07-31T04:00:48Z","snapshot_observed_at":"2026-07-06T20:57:47.748881Z","submitted_at":"2025-03-24T13:31:48Z","title":"AgentSpec: Customizable Runtime Enforcement for Safe and Reliable LLM Agents","version":3},"cited_work":{"arxiv_id":"2503.18666","doi":"10.48550/arxiv.2503.18666","metadata_source":"pith","pith_arxiv_id":"2503.18666","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"AgentSpec: Customizable Runtime Enforcement for Safe and Reliable LLM Agents","venue":"cs.AI","work_id":"2d265b31-7dcb-4ab3-8c83-e13bd5598435","year":2025},"citing_paper":{"arxiv_id":"2604.16706","last_updated":"2026-04-17T21:15:35Z","snapshot_observed_at":"2026-07-06T23:03:57.199731Z","submitted_at":"2026-04-17T21:15:35Z","title":"Evaluating Tool-Using Language Agents: Judge Reliability, Propagation Cascades, and Runtime Mitigation in AgentProp-Bench","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-10T08:00:45.789649Z"},"links":{"cited_paper":"/paper/2503.18666","citing_paper":"/paper/2604.16706"},"observation_digest":"sha256:1a4832e997f5355d23b1d7ad5cfee96bf0c62b27a0522a595312b7b1842008d5","observation_id":"7e54429f-3d8f-4a0b-8fe4-de845fd7585f","resolution":{"observed_at":"2026-05-14T21:24:32.777586Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-03T00:38:11.552641+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-03T00:38:11.552641+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.11171","last_updated":"2023-03-07T17:57:37Z","snapshot_observed_at":"2026-07-06T12:50:22.773056Z","submitted_at":"2022-03-21T17:48:52Z","title":"Self-Consistency Improves Chain of Thought Reasoning in Language Models","version":4},"cited_work":{"arxiv_id":"2203.11171","doi":"10.1101/2025.04.03.646459","metadata_source":"pith","pith_arxiv_id":"2203.11171","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Self-Consistency Improves Chain of Thought Reasoning in Language Models","venue":"cs.CL","work_id":"8c6d5a6b-b5cc-4105-9c84-9c34bb9375bb","year":2022},"citing_paper":{"arxiv_id":"2604.16706","last_updated":"2026-04-17T21:15:35Z","snapshot_observed_at":"2026-07-06T23:03:57.199731Z","submitted_at":"2026-04-17T21:15:35Z","title":"Evaluating Tool-Using Language Agents: Judge Reliability, Propagation Cascades, and Runtime Mitigation in AgentProp-Bench","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-10T08:00:45.789649Z"},"links":{"cited_paper":"/paper/2203.11171","citing_paper":"/paper/2604.16706"},"observation_digest":"sha256:0d2e46b898bad10985109feccf5b166c00ec5c81177fb8b3414360b1884d8261","observation_id":"dd33ece9-5654-4f19-b8dd-fa39584858ba","resolution":{"observed_at":"2026-05-10T08:02:25.004745Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-21T18:52:42.88633+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-21T18:52:42.88633+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.05659","last_updated":"2025-04-11T16:51:59Z","snapshot_observed_at":"2026-07-06T20:48:41.069542Z","submitted_at":"2025-03-07T18:20:30Z","title":"A Survey of Large Language Model Empowered Agents for Recommendation and Search: Towards Next-Generation Information Retrieval","version":2},"cited_work":{"arxiv_id":"2503.05659","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.05659","snapshot_observed_at":"2026-07-02T15:27:04.848109Z","title":"On generative agents in recommendation","venue":null,"work_id":"5c3b08d2-4900-4524-a5fe-72a13c59b742","year":2025},"citing_paper":{"arxiv_id":"2604.16706","last_updated":"2026-04-17T21:15:35Z","snapshot_observed_at":"2026-07-06T23:03:57.199731Z","submitted_at":"2026-04-17T21:15:35Z","title":"Evaluating Tool-Using Language Agents: Judge Reliability, Propagation Cascades, and Runtime Mitigation in AgentProp-Bench","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-10T08:00:45.789649Z"},"links":{"cited_paper":"/paper/2503.05659","citing_paper":"/paper/2604.16706"},"observation_digest":"sha256:96d7a2379cb4b6d211f70a044782395606209cf09ee584e7796d85e2785ac92a","observation_id":"0692cdc7-69fd-4913-adea-25be4156338a","resolution":{"observed_at":"2026-05-10T08:02:24.997039Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.19557","last_updated":"2025-02-26T20:50:11Z","snapshot_observed_at":"2026-07-06T20:43:22.572496Z","submitted_at":"2025-02-26T20:50:11Z","title":"Distill Not Only Data but Also Rewards: Can Smaller Language Models Surpass Larger Ones?","version":1},"cited_work":{"arxiv_id":"2502.19557","doi":"10.48550/arxiv.2502.19557","metadata_source":"arxiv_reference","pith_arxiv_id":"2502.19557","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Distill Not Only Data but Also Rewards: Can Smaller Language Models Surpass Larger Ones?","venue":"ArXiv.org","work_id":"47f144ed-a239-4c00-bd03-eae23ad603db","year":2025},"citing_paper":{"arxiv_id":"2604.16706","last_updated":"2026-04-17T21:15:35Z","snapshot_observed_at":"2026-07-06T23:03:57.199731Z","submitted_at":"2026-04-17T21:15:35Z","title":"Evaluating Tool-Using Language Agents: Judge Reliability, Propagation Cascades, and Runtime Mitigation in AgentProp-Bench","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-10T08:00:45.789649Z"},"links":{"cited_paper":"/paper/2502.19557","citing_paper":"/paper/2604.16706"},"observation_digest":"sha256:e160e9e84c28bd0ecdfa8124cd4ee3745656b7b8638e5cc4ee4e86df8b152052","observation_id":"e4370c7d-19fe-45f6-bbb4-5d9bb82833a9","resolution":{"observed_at":"2026-05-10T08:02:24.351219Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.12045","last_updated":"2024-06-17T19:33:08Z","snapshot_observed_at":"2026-08-02T22:19:29.043854Z","submitted_at":"2024-06-17T19:33:08Z","title":"$\\tau$-bench: A Benchmark for Tool-Agent-User Interaction in Real-World Domains","version":1},"cited_work":{"arxiv_id":"2406.12045","doi":"10.48550/arxiv.2406.12045","metadata_source":"pith","pith_arxiv_id":"2406.12045","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"$\\tau$-bench: A Benchmark for Tool-Agent-User Interaction in Real-World Domains","venue":"cs.AI","work_id":"6a8d8dc4-0cc0-4052-8109-abbcdcd4a962","year":2024},"citing_paper":{"arxiv_id":"2604.16706","last_updated":"2026-04-17T21:15:35Z","snapshot_observed_at":"2026-07-06T23:03:57.199731Z","submitted_at":"2026-04-17T21:15:35Z","title":"Evaluating Tool-Using Language Agents: Judge Reliability, Propagation Cascades, and Runtime Mitigation in AgentProp-Bench","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-10T08:00:45.789649Z"},"links":{"cited_paper":"/paper/2406.12045","citing_paper":"/paper/2604.16706"},"observation_digest":"sha256:138302faca4ab9fc8d4f89225b463f98621e83ef6a802f224e58795e1039619a","observation_id":"85ac5172-c564-4a96-a62e-0131fc66c5d6","resolution":{"observed_at":"2026-05-11T03:19:00.987380Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-14T18:20:21.86453+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-14T18:20:21.86453+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.16416","last_updated":"2026-04-23T17:36:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-20T17:59:23Z","title":"Survey on Evaluation of LLM-based Agents","version":2},"cited_work":{"arxiv_id":"2503.16416","doi":"10.48550/arxiv.2503.16416","metadata_source":"pith","pith_arxiv_id":"2503.16416","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"Survey on Evaluation of LLM-based Agents","venue":"cs.AI","work_id":"d9ac1186-88b1-41bd-9bc7-8a0b87e6f305","year":2025},"citing_paper":{"arxiv_id":"2604.16706","last_updated":"2026-04-17T21:15:35Z","snapshot_observed_at":"2026-07-06T23:03:57.199731Z","submitted_at":"2026-04-17T21:15:35Z","title":"Evaluating Tool-Using Language Agents: Judge Reliability, Propagation Cascades, and Runtime Mitigation in AgentProp-Bench","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-10T08:00:45.789649Z"},"links":{"cited_paper":"/paper/2503.16416","citing_paper":"/paper/2604.16706"},"observation_digest":"sha256:05a693dad4ac1407fce69c53b9cd360e1dd472bd67cfd8361083d0b5e33c8168","observation_id":"0f1a841e-dc10-40d0-b40d-52b4d4e22e49","resolution":{"observed_at":"2026-05-10T08:02:25.007134Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-11T06:20:44.248546+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T06:20:44.248546+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2308.07107","doi":"10.48550/arxiv.2308.07107","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Large language models for information retrieval: A survey","venue":"arXiv (Cornell University)","work_id":"ff471f2d-dc3e-459c-81a9-9a40d29e96f8","year":2023},"citing_paper":{"arxiv_id":"2604.16706","last_updated":"2026-04-17T21:15:35Z","snapshot_observed_at":"2026-07-06T23:03:57.199731Z","submitted_at":"2026-04-17T21:15:35Z","title":"Evaluating Tool-Using Language Agents: Judge Reliability, Propagation Cascades, and Runtime Mitigation in AgentProp-Bench","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-10T08:00:45.789649Z"},"links":{"citing_paper":"/paper/2604.16706"},"observation_digest":"sha256:69b8a140f5f65218ab7b4fb3dd4434bcbfe63202ce05e78c349d2ca7106c4a6f","observation_id":"dada0be9-080c-4b50-bfc1-8021b455ae3a","resolution":{"observed_at":"2026-05-10T08:02:24.989481Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-01T13:38:15.875295+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-01T13:38:15.875295+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1145/3748302","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"A survey on the memory mechanism of large language model- based agents.ACM Transactions on Information Systems, 43(6):155:1–155:47","venue":"ACM Transactions on Information Systems","work_id":"523e1a9d-c782-4e01-9644-c33da60ddd2e","year":2025},"citing_paper":{"arxiv_id":"2604.16706","last_updated":"2026-04-17T21:15:35Z","snapshot_observed_at":"2026-07-06T23:03:57.199731Z","submitted_at":"2026-04-17T21:15:35Z","title":"Evaluating Tool-Using Language Agents: Judge Reliability, Propagation Cascades, and Runtime Mitigation in AgentProp-Bench","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-10T08:00:45.789649Z"},"links":{"citing_paper":"/paper/2604.16706"},"observation_digest":"sha256:a51f27bd7f168b32016ea0c624181220d8db7a7c087fc7105e4a4a2dce92feea","observation_id":"24978f4b-1c75-49a6-9540-898137b7599e","resolution":{"observed_at":"2026-05-10T08:02:24.361394Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-01T10:38:14.23452+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-01T10:38:14.23452+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.05685","last_updated":"2023-12-24T02:01:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-09T05:55:52Z","title":"Judging LLM-as-a-Judge with MT-Bench and Chatbot Arena","version":4},"cited_work":{"arxiv_id":"2306.05685","doi":"10.1109/4235.797969","metadata_source":"pith","pith_arxiv_id":"2306.05685","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Judging LLM-as-a-Judge with MT-Bench and Chatbot Arena","venue":"cs.CL","work_id":"d0c30cd7-81e1-4159-a87f-f6adca77ff08","year":2023},"citing_paper":{"arxiv_id":"2604.16706","last_updated":"2026-04-17T21:15:35Z","snapshot_observed_at":"2026-07-06T23:03:57.199731Z","submitted_at":"2026-04-17T21:15:35Z","title":"Evaluating Tool-Using Language Agents: Judge Reliability, Propagation Cascades, and Runtime Mitigation in AgentProp-Bench","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-10T08:00:45.789649Z"},"links":{"cited_paper":"/paper/2306.05685","citing_paper":"/paper/2604.16706"},"observation_digest":"sha256:5ea986faed4597a57c528c53f7a4832e36c4cdec8dbdc5bf8bb2461548cd54f1","observation_id":"5b395675-7da1-40a3-9490-314c7bb298d0","resolution":{"observed_at":"2026-05-10T18:52:59.240297Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2604.16706","last_updated":"2026-04-17T21:15:35Z","latest_version":1,"primary_category":"cs.AI","snapshot_observed_at":"2026-07-06T23:03:57.199731Z","submitted_at":"2026-04-17T21:15:35Z","title":"Evaluating Tool-Using Language Agents: Judge Reliability, Propagation Cascades, and Runtime Mitigation in AgentProp-Bench"},"reference_resolution":{"displayed":32,"state_counts":{"malformed_identifier":0,"metadata_mismatch":6,"parse_uncertain":0,"unresolved":0,"verified_exact":26,"verified_fuzzy":0},"total_outbound_references":32},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"thesis":"As of 6 August 2026, this Paper Citation Record lists 32 of 32 outbound references and 4 inbound Pith citation observations for arXiv:2604.16706."}