{"as_of":"2026-08-09T07:57:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:53ddd5a195f7b16db3973a5938eafb4c47f82bc9966f654b5258ca4e0e09c5f1","coverage":[{"denominator":70,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":70,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T11:10:45.767347Z","state":"measured"},{"denominator":72,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":72,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-22T03:53:03.807297Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-22T03:54:34.003611Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.03332","last_updated":"2025-06-03T19:26:23Z","snapshot_observed_at":"2026-08-07T11:03:26.433661Z","submitted_at":"2025-06-03T19:26:23Z","title":"Helpful Agent Meets Deceptive Judge: Understanding Vulnerabilities in Agentic Workflows","version":1},"cited_work":{"arxiv_id":"2506.03332","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.03332","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Helpful agent meets deceptive judge: Understanding vulnerabilities in agentic workflows","venue":null,"work_id":"7f5159e8-a0d9-4833-98a9-abb87861d7cb","year":2025},"citing_paper":{"arxiv_id":"2605.11003","last_updated":"2026-05-10T04:05:31Z","snapshot_observed_at":"2026-07-06T23:22:52.369277Z","submitted_at":"2026-05-10T04:05:31Z","title":"The Authorization-Execution Gap Is a Major Safety and Security Problem in Open-World Agents","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-13T01:19:48.189694Z"},"links":{"cited_paper":"/paper/2506.03332","citing_paper":"/paper/2605.11003"},"observation_digest":"sha256:72365d19ee080c9f24b50e109a705082befed8e5097a78a8a551c261b09e5dee","observation_id":"7789b71c-de9e-4cfe-a038-da6c13ecd995","resolution":{"observed_at":"2026-05-13T01:22:01.851015Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.03332","last_updated":"2025-06-03T19:26:23Z","snapshot_observed_at":"2026-08-07T11:03:26.433661Z","submitted_at":"2025-06-03T19:26:23Z","title":"Helpful Agent Meets Deceptive Judge: Understanding Vulnerabilities in Agentic Workflows","version":1},"cited_work":{"arxiv_id":"2506.03332","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.03332","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Helpful agent meets deceptive judge: Understanding vulnerabilities in agentic workflows","venue":null,"work_id":"7f5159e8-a0d9-4833-98a9-abb87861d7cb","year":2025},"citing_paper":{"arxiv_id":"2605.22534","last_updated":"2026-05-21T14:24:20Z","snapshot_observed_at":"2026-07-06T23:32:49.530788Z","submitted_at":"2026-05-21T14:24:20Z","title":"Why Are Agentic Pull Requests Merged or Rejected? An Empirical Study","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-22T03:53:03.807297Z"},"links":{"cited_paper":"/paper/2506.03332","citing_paper":"/paper/2605.22534"},"observation_digest":"sha256:139705bc6f172ec6610e01f2b41965d98a0a8c63c943597c6079c2a30de80389","observation_id":"984043c9-0be9-42eb-b35b-bf409fdce334","resolution":{"observed_at":"2026-05-22T03:54:34.006576Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2506.03332/citation-record","integrity":"/paper/2506.03332/integrity","json":"/paper/2506.03332/citation-record.json","paper":"/paper/2506.03332"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:10:47.968054Z","title":"ReConcile: Round-table conference improves reasoning via consensus among diverse LLMs","venue":null,"work_id":"3037374a-4725-4033-94cf-856bc53c7944","year":2024},"citing_paper":{"arxiv_id":"2506.03332","last_updated":"2025-06-03T19:26:23Z","snapshot_observed_at":"2026-08-07T11:03:26.433661Z","submitted_at":"2025-06-03T19:26:23Z","title":"Helpful Agent Meets Deceptive Judge: Understanding Vulnerabilities in Agentic Workflows","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T11:10:45.517449Z"},"links":{"citing_paper":"/paper/2506.03332"},"observation_digest":"sha256:6175e1f983f07f25ad2c7830fe537bb25e9ff5c96c5e78d3fb6223a4935ed56f","observation_id":"8b8395ea-c8c5-4af7-a3da-a1ff96abb61e","resolution":{"observed_at":"2026-08-07T11:10:48.042471Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1803.05457","last_updated":"2018-03-14T18:04:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2018-03-14T18:04:21Z","title":"Think you have Solved Question Answering? Try ARC, the AI2 Reasoning Challenge","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1803.05457","snapshot_observed_at":"2026-08-07T11:10:45.521483Z","title":"Think you have solved question answering? try arc, the ai2 reasoning challenge.arXiv preprint arXiv:1803.05457, 2018","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.03332","last_updated":"2025-06-03T19:26:23Z","snapshot_observed_at":"2026-08-07T11:03:26.433661Z","submitted_at":"2025-06-03T19:26:23Z","title":"Helpful Agent Meets Deceptive Judge: Understanding Vulnerabilities in Agentic Workflows","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T11:10:45.521483Z"},"links":{"cited_paper":"/paper/1803.05457","citing_paper":"/paper/2506.03332"},"observation_digest":"sha256:db3cbc5f6eb2402c9b2e8b0a5f70221276612eb0affa0e772b5f754b5f6288d4","observation_id":"1361cfdc-fabe-4716-b7f6-8fefba645e89","resolution":{"observed_at":"2026-08-07T11:10:45.521483Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:10:47.794568Z","title":"Synthetic disinformation attacks on automated fact verification systems","venue":null,"work_id":"5deee2bb-ef18-4388-8d21-c0d2ad506ac8","year":2022},"citing_paper":{"arxiv_id":"2506.03332","last_updated":"2025-06-03T19:26:23Z","snapshot_observed_at":"2026-08-07T11:03:26.433661Z","submitted_at":"2025-06-03T19:26:23Z","title":"Helpful Agent Meets Deceptive Judge: Understanding Vulnerabilities in Agentic Workflows","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T11:10:45.524917Z"},"links":{"citing_paper":"/paper/2506.03332"},"observation_digest":"sha256:8a6d9537372380175685b8b2be9a590239d4fa7fa48ac61e70940c380b1a5d11","observation_id":"1676adec-811d-4096-b08f-16bcf22e89b1","resolution":{"observed_at":"2026-08-07T11:10:47.859384Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.14325","last_updated":"2023-05-23T17:55:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-05-23T17:55:11Z","title":"Improving Factuality and Reasoning in Language Models through Multiagent Debate","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.14325","snapshot_observed_at":"2026-08-07T11:10:45.528343Z","title":"Improv- ing factuality and reasoning in language models through multiagent debate.arXiv preprint arXiv:2305.14325, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.03332","last_updated":"2025-06-03T19:26:23Z","snapshot_observed_at":"2026-08-07T11:03:26.433661Z","submitted_at":"2025-06-03T19:26:23Z","title":"Helpful Agent Meets Deceptive Judge: Understanding Vulnerabilities in Agentic Workflows","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T11:10:45.528343Z"},"links":{"cited_paper":"/paper/2305.14325","citing_paper":"/paper/2506.03332"},"observation_digest":"sha256:c80ed4061a9d95656b2eb3de736d7faeae4071f1979d2a8ab45e66fd2f096e53","observation_id":"b8f5c337-7361-4ea6-bcfd-9825eb220d40","resolution":{"observed_at":"2026-08-07T11:10:45.528343Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1903.00161","last_updated":"2019-04-16T21:22:39Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2019-03-01T05:32:01Z","title":"DROP: A Reading Comprehension Benchmark Requiring Discrete Reasoning Over Paragraphs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1903.00161","snapshot_observed_at":"2026-08-07T11:10:45.531959Z","title":"Drop: A reading comprehension benchmark requiring discrete reasoning over paragraphs","venue":null,"work_id":null,"year":1903},"citing_paper":{"arxiv_id":"2506.03332","last_updated":"2025-06-03T19:26:23Z","snapshot_observed_at":"2026-08-07T11:03:26.433661Z","submitted_at":"2025-06-03T19:26:23Z","title":"Helpful Agent Meets Deceptive Judge: Understanding Vulnerabilities in Agentic Workflows","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T11:10:45.531959Z"},"links":{"cited_paper":"/paper/1903.00161","citing_paper":"/paper/2506.03332"},"observation_digest":"sha256:3350d13b8b35ffa0a0cb39ad1d3400ecade2512be3ad5f5e2bc130fec4d970c1","observation_id":"3aba0d3b-023e-48d5-8fb5-9a0f63d0116c","resolution":{"observed_at":"2026-08-07T11:10:45.531959Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1704.05179","last_updated":"2017-06-11T11:51:06Z","snapshot_observed_at":"2026-08-08T08:03:26.866593Z","submitted_at":"2017-04-18T02:42:17Z","title":"SearchQA: A New Q&A Dataset Augmented with Context from a Search Engine","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1704.05179","snapshot_observed_at":"2026-08-07T11:10:45.536054Z","title":"Searchqa: A new q&a dataset augmented with context from a search engine.arXiv preprint arXiv:1704.05179, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.03332","last_updated":"2025-06-03T19:26:23Z","snapshot_observed_at":"2026-08-07T11:03:26.433661Z","submitted_at":"2025-06-03T19:26:23Z","title":"Helpful Agent Meets Deceptive Judge: Understanding Vulnerabilities in Agentic Workflows","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T11:10:45.536054Z"},"links":{"cited_paper":"/paper/1704.05179","citing_paper":"/paper/2506.03332"},"observation_digest":"sha256:a8240bbd3ff79863e8fb399a58bb35b61965f70732352539a052d44483caa160","observation_id":"f9c8f781-43ed-4575-98e9-6d9d5f450882","resolution":{"observed_at":"2026-08-07T11:10:45.536054Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.04910","last_updated":"2023-03-16T01:09:08Z","snapshot_observed_at":"2026-08-05T15:17:11.739277Z","submitted_at":"2023-03-08T22:00:15Z","title":"Baldur: Whole-Proof Generation and Repair with Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.04910","snapshot_observed_at":"2026-08-07T11:10:45.540047Z","title":"Rabe, Talia Ringer, and Yuriy Brun","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.03332","last_updated":"2025-06-03T19:26:23Z","snapshot_observed_at":"2026-08-07T11:03:26.433661Z","submitted_at":"2025-06-03T19:26:23Z","title":"Helpful Agent Meets Deceptive Judge: Understanding Vulnerabilities in Agentic Workflows","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T11:10:45.540047Z"},"links":{"cited_paper":"/paper/2303.04910","citing_paper":"/paper/2506.03332"},"observation_digest":"sha256:c6b916e64ade8a9b8bb1b78b44492a3bc9430360295e7f4ed3f4637416d8fd01","observation_id":"c46706d3-b975-4a89-9062-bb9564179cb3","resolution":{"observed_at":"2026-08-07T11:10:45.540047Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.11738","last_updated":"2024-02-21T12:59:21Z","snapshot_observed_at":"2026-07-31T18:12:14.483728Z","submitted_at":"2023-05-19T15:19:44Z","title":"CRITIC: Large Language Models Can Self-Correct with Tool-Interactive Critiquing","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.11738","snapshot_observed_at":"2026-08-07T11:10:45.544006Z","title":"CRITIC: Large language models can self-correct with tool-interactive critiquing","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03332","last_updated":"2025-06-03T19:26:23Z","snapshot_observed_at":"2026-08-07T11:03:26.433661Z","submitted_at":"2025-06-03T19:26:23Z","title":"Helpful Agent Meets Deceptive Judge: Understanding Vulnerabilities in Agentic Workflows","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T11:10:45.544006Z"},"links":{"cited_paper":"/paper/2305.11738","citing_paper":"/paper/2506.03332"},"observation_digest":"sha256:6c4439e53a63a34f3382389aa5c0b32debfbcb9edaff531d104c01c2766cc1dd","observation_id":"a53f184f-325a-4c2d-87ab-0386c753d6f8","resolution":{"observed_at":"2026-08-07T11:10:45.544006Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:10:47.647691Z","title":"The larger the better? improved LLM code-generation via budget reallocation","venue":null,"work_id":"223b6017-cb92-4413-92c8-fa2fd25570fc","year":2024},"citing_paper":{"arxiv_id":"2506.03332","last_updated":"2025-06-03T19:26:23Z","snapshot_observed_at":"2026-08-07T11:03:26.433661Z","submitted_at":"2025-06-03T19:26:23Z","title":"Helpful Agent Meets Deceptive Judge: Understanding Vulnerabilities in Agentic Workflows","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T11:10:45.547462Z"},"links":{"citing_paper":"/paper/2506.03332"},"observation_digest":"sha256:a75864d8454eb0c6eb28e6fc34c99f16f316eb9d7a36d1e149d13010e150915a","observation_id":"014c86a3-04a1-4df9-b5b7-e1cb9428fb57","resolution":{"observed_at":"2026-08-07T11:10:47.713786Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2009.03300","last_updated":"2021-01-12T18:57:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-09-07T17:59:25Z","title":"Measuring Massive Multitask Language Understanding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2009.03300","snapshot_observed_at":"2026-08-07T11:10:45.550880Z","title":"Measuring massive multitask language understanding.arXiv preprint arXiv:2009.03300, 2020","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2506.03332","last_updated":"2025-06-03T19:26:23Z","snapshot_observed_at":"2026-08-07T11:03:26.433661Z","submitted_at":"2025-06-03T19:26:23Z","title":"Helpful Agent Meets Deceptive Judge: Understanding Vulnerabilities in Agentic Workflows","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T11:10:45.550880Z"},"links":{"cited_paper":"/paper/2009.03300","citing_paper":"/paper/2506.03332"},"observation_digest":"sha256:1b3b2819ae2e3a59cd4c33c8d2e4dba8dd623631cacad8b7d11165c350a951c4","observation_id":"29a76a2f-4925-44d7-8582-e6a5c9d92acb","resolution":{"observed_at":"2026-08-07T11:10:45.550880Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.01798","last_updated":"2024-03-14T04:27:52Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-03T04:56:12Z","title":"Large Language Models Cannot Self-Correct Reasoning Yet","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.01798","snapshot_observed_at":"2026-08-07T11:10:45.554308Z","title":"Large language models cannot self-correct reasoning yet.arXiv preprint arXiv:2310.01798, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.03332","last_updated":"2025-06-03T19:26:23Z","snapshot_observed_at":"2026-08-07T11:03:26.433661Z","submitted_at":"2025-06-03T19:26:23Z","title":"Helpful Agent Meets Deceptive Judge: Understanding Vulnerabilities in Agentic Workflows","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T11:10:45.554308Z"},"links":{"cited_paper":"/paper/2310.01798","citing_paper":"/paper/2506.03332"},"observation_digest":"sha256:82b6e61082644899ea79133375d82b9e3342706f4052eec11264010a98d36157","observation_id":"424f8645-1142-4952-b467-92cd4ba4e026","resolution":{"observed_at":"2026-08-07T11:10:45.554308Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21276","last_updated":"2024-10-25T17:43:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-25T17:43:01Z","title":"GPT-4o System Card","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.21276","snapshot_observed_at":"2026-08-07T11:10:45.557635Z","title":"Gpt-4o system card.arXiv preprint arXiv:2410.21276, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03332","last_updated":"2025-06-03T19:26:23Z","snapshot_observed_at":"2026-08-07T11:03:26.433661Z","submitted_at":"2025-06-03T19:26:23Z","title":"Helpful Agent Meets Deceptive Judge: Understanding Vulnerabilities in Agentic Workflows","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T11:10:45.557635Z"},"links":{"cited_paper":"/paper/2410.21276","citing_paper":"/paper/2506.03332"},"observation_digest":"sha256:475f1727b22bceb8295abd80445888007bc15573b36ed5f109308e57590aa544","observation_id":"9e438a02-8bcd-42db-ad95-d3711708e956","resolution":{"observed_at":"2026-08-07T11:10:45.557635Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16720","last_updated":"2026-04-30T02:46:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-21T18:04:31Z","title":"OpenAI o1 System Card","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.16720","snapshot_observed_at":"2026-08-07T11:10:45.561129Z","title":"Openai o1 system card.arXiv preprint arXiv:2412.16720, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03332","last_updated":"2025-06-03T19:26:23Z","snapshot_observed_at":"2026-08-07T11:03:26.433661Z","submitted_at":"2025-06-03T19:26:23Z","title":"Helpful Agent Meets Deceptive Judge: Understanding Vulnerabilities in Agentic Workflows","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T11:10:45.561129Z"},"links":{"cited_paper":"/paper/2412.16720","citing_paper":"/paper/2506.03332"},"observation_digest":"sha256:2f889b68e49f963491297842fd9e60652ac2a26190efe20c06b8e576d5024a46","observation_id":"369e756e-bf62-4a64-828a-cc97e895e1f9","resolution":{"observed_at":"2026-08-07T11:10:45.561129Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1705.03551","last_updated":"2017-05-13T21:12:37Z","snapshot_observed_at":"2026-08-02T11:13:42.401488Z","submitted_at":"2017-05-09T21:35:07Z","title":"TriviaQA: A Large Scale Distantly Supervised Challenge Dataset for Reading Comprehension","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1705.03551","snapshot_observed_at":"2026-08-07T11:10:45.564319Z","title":"Triviaqa: A large scale distantly supervised challenge dataset for reading comprehension.arXiv preprint arXiv:1705.03551, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.03332","last_updated":"2025-06-03T19:26:23Z","snapshot_observed_at":"2026-08-07T11:03:26.433661Z","submitted_at":"2025-06-03T19:26:23Z","title":"Helpful Agent Meets Deceptive Judge: Understanding Vulnerabilities in Agentic Workflows","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T11:10:45.564319Z"},"links":{"cited_paper":"/paper/1705.03551","citing_paper":"/paper/2506.03332"},"observation_digest":"sha256:40f0d7bc7d58e44168193a8f5833a614f8582312e77d4daa404c307cfc360445","observation_id":"0d8abfcb-76f5-464c-ac2c-af43ba4c354c","resolution":{"observed_at":"2026-08-07T11:10:45.564319Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:10:47.485503Z","title":"When can LLMs actually correct their own mistakes? a critical survey of self-correction of LLMs.Transactions of the Association for Computational Linguistics, 12:1417–1440, 2024","venue":null,"work_id":"a340fea1-2fa7-4442-bba4-c18cb8025d79","year":2024},"citing_paper":{"arxiv_id":"2506.03332","last_updated":"2025-06-03T19:26:23Z","snapshot_observed_at":"2026-08-07T11:03:26.433661Z","submitted_at":"2025-06-03T19:26:23Z","title":"Helpful Agent Meets Deceptive Judge: Understanding Vulnerabilities in Agentic Workflows","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T11:10:45.567712Z"},"links":{"citing_paper":"/paper/2506.03332"},"observation_digest":"sha256:4faeb5907a96ee1dae9b7b8d5e0161cd7e17c81d7536e31e79eb5183fda4ca5d","observation_id":"65cd85af-c690-480d-b6df-a537f449e9fd","resolution":{"observed_at":"2026-08-07T11:10:47.579967Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.01502","last_updated":"2024-07-01T17:48:14Z","snapshot_observed_at":"2026-08-06T22:15:08.500389Z","submitted_at":"2024-07-01T17:48:14Z","title":"AI Agents That Matter","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.01502","snapshot_observed_at":"2026-08-07T11:10:45.571170Z","title":"Siegel, Nitya Nadgir, and Arvind Narayanan","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03332","last_updated":"2025-06-03T19:26:23Z","snapshot_observed_at":"2026-08-07T11:03:26.433661Z","submitted_at":"2025-06-03T19:26:23Z","title":"Helpful Agent Meets Deceptive Judge: Understanding Vulnerabilities in Agentic Workflows","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T11:10:45.571170Z"},"links":{"cited_paper":"/paper/2407.01502","citing_paper":"/paper/2506.03332"},"observation_digest":"sha256:c5e9868eb82879c2cd0a6260ba842253c8791dd68261c728e0289f090c53c201","observation_id":"81f7c4be-d452-422d-9d8f-d5bd2c12d249","resolution":{"observed_at":"2026-08-07T11:10:45.571170Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:10:47.271830Z","title":"Bowman, Tim Rocktäschel, and Ethan Perez","venue":null,"work_id":"29186178-5882-4705-938c-7897375c89f1","year":2024},"citing_paper":{"arxiv_id":"2506.03332","last_updated":"2025-06-03T19:26:23Z","snapshot_observed_at":"2026-08-07T11:03:26.433661Z","submitted_at":"2025-06-03T19:26:23Z","title":"Helpful Agent Meets Deceptive Judge: Understanding Vulnerabilities in Agentic Workflows","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T11:10:45.574364Z"},"links":{"citing_paper":"/paper/2506.03332"},"observation_digest":"sha256:f93d343c0c183f977619a59e2ca5dc8fbcaecde8d2e9f0434fc26a1926e9e659","observation_id":"ec74cd6d-d6ba-485c-be06-83020276e60d","resolution":{"observed_at":"2026-08-07T11:10:47.375433Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:10:45.577818Z","title":"Natural questions: a benchmark for question answering research.Transactions of the Association for Computational Linguistics, 7:453–466, 2019","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.03332","last_updated":"2025-06-03T19:26:23Z","snapshot_observed_at":"2026-08-07T11:03:26.433661Z","submitted_at":"2025-06-03T19:26:23Z","title":"Helpful Agent Meets Deceptive Judge: Understanding Vulnerabilities in Agentic Workflows","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T11:10:45.577818Z"},"links":{"citing_paper":"/paper/2506.03332"},"observation_digest":"sha256:149a3c7aea8dfa1c690fb254aa6d39bd3f1dbf1b00d85499666efddc99d700e4","observation_id":"52cdb31c-8fde-43c1-9c84-baa153c6daca","resolution":{"observed_at":"2026-08-07T11:10:45.577818Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:10:45.581968Z","title":"Making language models better reasoners with step-aware verifier","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.03332","last_updated":"2025-06-03T19:26:23Z","snapshot_observed_at":"2026-08-07T11:03:26.433661Z","submitted_at":"2025-06-03T19:26:23Z","title":"Helpful Agent Meets Deceptive Judge: Understanding Vulnerabilities in Agentic Workflows","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T11:10:45.581968Z"},"links":{"citing_paper":"/paper/2506.03332"},"observation_digest":"sha256:7f5605e12277068dfa9ce91f877f6e1436dd55d2807cb4480f453d97be56df01","observation_id":"70b948cd-baec-4553-8abd-ef315209b3b4","resolution":{"observed_at":"2026-08-07T11:10:45.581968Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:10:47.091617Z","title":"Encouraging divergent thinking in large language models through multi- agent debate","venue":null,"work_id":"aeb97129-4f5f-4e63-aa58-1471b85535b2","year":2024},"citing_paper":{"arxiv_id":"2506.03332","last_updated":"2025-06-03T19:26:23Z","snapshot_observed_at":"2026-08-07T11:03:26.433661Z","submitted_at":"2025-06-03T19:26:23Z","title":"Helpful Agent Meets Deceptive Judge: Understanding Vulnerabilities in Agentic Workflows","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T11:10:45.585154Z"},"links":{"citing_paper":"/paper/2506.03332"},"observation_digest":"sha256:ba1f286eeefb9da8086cbb3a8eb60c41de17360c2254b5b58e5f8b13426890d0","observation_id":"3e3d13e9-9249-4e03-8909-d85da7e37c06","resolution":{"observed_at":"2026-08-07T11:10:47.161684Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.17651","last_updated":"2023-05-25T19:13:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-03-30T18:30:01Z","title":"Self-Refine: Iterative Refinement with Self-Feedback","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.17651","snapshot_observed_at":"2026-08-07T11:10:45.589027Z","title":"Self- Refine: Iterative refinement with self-feedback.arXiv preprint arXiv:2303.17651, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.03332","last_updated":"2025-06-03T19:26:23Z","snapshot_observed_at":"2026-08-07T11:03:26.433661Z","submitted_at":"2025-06-03T19:26:23Z","title":"Helpful Agent Meets Deceptive Judge: Understanding Vulnerabilities in Agentic Workflows","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T11:10:45.589027Z"},"links":{"cited_paper":"/paper/2303.17651","citing_paper":"/paper/2506.03332"},"observation_digest":"sha256:1e84f220427255dcbf74a4c7e1bf4bd3e610ca94c36b7521721ed0d1f83211cb","observation_id":"b58eb157-5c5c-40ba-b168-9470b7f9814c","resolution":{"observed_at":"2026-08-07T11:10:45.589027Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.08702","last_updated":"2023-11-15T05:05:40Z","snapshot_observed_at":"2026-07-06T16:47:45.504109Z","submitted_at":"2023-11-15T05:05:40Z","title":"Debate Helps Supervise Unreliable Experts","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.08702","snapshot_observed_at":"2026-08-07T11:10:45.592227Z","title":"Debate helps supervise unreliable experts.arXiv preprint arXiv:2311.08702, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.03332","last_updated":"2025-06-03T19:26:23Z","snapshot_observed_at":"2026-08-07T11:03:26.433661Z","submitted_at":"2025-06-03T19:26:23Z","title":"Helpful Agent Meets Deceptive Judge: Understanding Vulnerabilities in Agentic Workflows","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T11:10:45.592227Z"},"links":{"cited_paper":"/paper/2311.08702","citing_paper":"/paper/2506.03332"},"observation_digest":"sha256:2f9bcc6b6d3ceaa627003269c5c68ded22c6442a19a57dd96a1d3b0eabbb84d7","observation_id":"f6843d3e-326c-48dd-9049-be2657dc59ad","resolution":{"observed_at":"2026-08-07T11:10:45.592227Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:10:46.926507Z","title":"Faitheval: Can your language model stay faithful to context, even if ”the moon is made of marshmallows”","venue":null,"work_id":"9b257117-ba27-4458-87b4-64e405c91c6f","year":2025},"citing_paper":{"arxiv_id":"2506.03332","last_updated":"2025-06-03T19:26:23Z","snapshot_observed_at":"2026-08-07T11:03:26.433661Z","submitted_at":"2025-06-03T19:26:23Z","title":"Helpful Agent Meets Deceptive Judge: Understanding Vulnerabilities in Agentic Workflows","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T11:10:45.595523Z"},"links":{"citing_paper":"/paper/2506.03332"},"observation_digest":"sha256:63829c46e0a7a49a3caac2efa721f1cd7d8dffb2d8cd3b4d73de6c8e95aababc","observation_id":"b140cf55-d037-4299-a99d-98c319d50c95","resolution":{"observed_at":"2026-08-07T11:10:46.993915Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:10:46.737060Z","title":"Lever: Learning to verify language-to-code generation with execution","venue":null,"work_id":"8fcccc7e-9765-4420-bc06-9c6b29b151d8","year":2023},"citing_paper":{"arxiv_id":"2506.03332","last_updated":"2025-06-03T19:26:23Z","snapshot_observed_at":"2026-08-07T11:03:26.433661Z","submitted_at":"2025-06-03T19:26:23Z","title":"Helpful Agent Meets Deceptive Judge: Understanding Vulnerabilities in Agentic Workflows","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T11:10:45.598687Z"},"links":{"citing_paper":"/paper/2506.03332"},"observation_digest":"sha256:20c4062011012240e6cabca28ed0a54b338ad4b7ad12d6995cd893af4b801902","observation_id":"0e540f63-cb26-4645-bd04-120ec0f23f93","resolution":{"observed_at":"2026-08-07T11:10:46.847888Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.13661","last_updated":"2023-10-26T20:45:39Z","snapshot_observed_at":"2026-07-06T15:31:05.250637Z","submitted_at":"2023-05-23T04:10:26Z","title":"On the Risk of Misinformation Pollution with Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.13661","snapshot_observed_at":"2026-08-07T11:10:45.601797Z","title":"On the risk of misinformation pollution with large language models.arXiv preprint arXiv:2305.13661, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.03332","last_updated":"2025-06-03T19:26:23Z","snapshot_observed_at":"2026-08-07T11:03:26.433661Z","submitted_at":"2025-06-03T19:26:23Z","title":"Helpful Agent Meets Deceptive Judge: Understanding Vulnerabilities in Agentic Workflows","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T11:10:45.601797Z"},"links":{"cited_paper":"/paper/2305.13661","citing_paper":"/paper/2506.03332"},"observation_digest":"sha256:3d4ec4229f7fdaac6f001b37e7227b62d036784b4d535212d797b3332a4c2761","observation_id":"a94a1d61-8e0d-470a-8a80-68e877edd8e6","resolution":{"observed_at":"2026-08-07T11:10:45.601797Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.06551","last_updated":"2024-10-07T08:49:49Z","snapshot_observed_at":"2026-08-06T11:46:01.178597Z","submitted_at":"2024-07-09T05:16:22Z","title":"OffsetBias: Leveraging Debiased Data for Tuning Evaluators","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.06551","snapshot_observed_at":"2026-08-07T11:10:45.605360Z","title":"Offsetbias: Leveraging debiased data for tuning evaluators.arXiv preprint arXiv:2407.06551, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03332","last_updated":"2025-06-03T19:26:23Z","snapshot_observed_at":"2026-08-07T11:03:26.433661Z","submitted_at":"2025-06-03T19:26:23Z","title":"Helpful Agent Meets Deceptive Judge: Understanding Vulnerabilities in Agentic Workflows","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T11:10:45.605360Z"},"links":{"cited_paper":"/paper/2407.06551","citing_paper":"/paper/2506.03332"},"observation_digest":"sha256:7b89beff9162a469441aa83f03c6f0398c63cfa3d1f3ece2dace5d9b26552ba1","observation_id":"56114032-d189-4cae-8ef5-06c0cdd39060","resolution":{"observed_at":"2026-08-07T11:10:45.605360Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:10:46.588711Z","title":"Bowman, Amanda Askell, Roger Grosse, Danny Hernandez, Deep Ganguli, Evan Hubinger, Nicholas Schiefer, and Jared Kaplan","venue":null,"work_id":"f069e13a-0c10-4774-b7c0-4cf3ecb8d6bb","year":2023},"citing_paper":{"arxiv_id":"2506.03332","last_updated":"2025-06-03T19:26:23Z","snapshot_observed_at":"2026-08-07T11:03:26.433661Z","submitted_at":"2025-06-03T19:26:23Z","title":"Helpful Agent Meets Deceptive Judge: Understanding Vulnerabilities in Agentic Workflows","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T11:10:45.608726Z"},"links":{"citing_paper":"/paper/2506.03332"},"observation_digest":"sha256:4ae69e814f7f61f97f2a318532e594c0f3c51809363e37ddffddb2389586a22f","observation_id":"8c3f49e0-dbb3-4f3a-828b-3ad7cfbcd84d","resolution":{"observed_at":"2026-08-07T11:10:46.671505Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:10:45.611812Z","title":"Gpqa: A graduate-level google-proof q&a benchmark","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03332","last_updated":"2025-06-03T19:26:23Z","snapshot_observed_at":"2026-08-07T11:03:26.433661Z","submitted_at":"2025-06-03T19:26:23Z","title":"Helpful Agent Meets Deceptive Judge: Understanding Vulnerabilities in Agentic Workflows","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T11:10:45.611812Z"},"links":{"citing_paper":"/paper/2506.03332"},"observation_digest":"sha256:c42c6d7a074010a323223ae875ddd8fa717649f80e118454e407e2c52198301d","observation_id":"a25700a9-0615-4de9-a465-29cc43230d9a","resolution":{"observed_at":"2026-08-07T11:10:45.611812Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.15254","last_updated":"2025-06-10T21:52:15Z","snapshot_observed_at":"2026-07-06T19:20:37.430389Z","submitted_at":"2024-09-23T17:53:42Z","title":"Archon: An Architecture Search Framework for Inference-Time Techniques","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.15254","snapshot_observed_at":"2026-08-07T11:10:45.615625Z","title":"Kelly Buchanan, Mayee Chen, Neel Guha, Christopher Ré, and Azalia Mirho- seini","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03332","last_updated":"2025-06-03T19:26:23Z","snapshot_observed_at":"2026-08-07T11:03:26.433661Z","submitted_at":"2025-06-03T19:26:23Z","title":"Helpful Agent Meets Deceptive Judge: Understanding Vulnerabilities in Agentic Workflows","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T11:10:45.615625Z"},"links":{"cited_paper":"/paper/2409.15254","citing_paper":"/paper/2506.03332"},"observation_digest":"sha256:839d6bfaf8a796220c2c7098f9c5ec574aaa7f6f6ff13b6014d128a83ecf12e6","observation_id":"f78f1aca-f91e-42a5-b10a-e3c0dfaf3c88","resolution":{"observed_at":"2026-08-07T11:10:45.615625Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:10:45.618993Z","title":"Winogrande: An adversarial winograd schema challenge at scale.Communications of the ACM, 64(9):99–106, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.03332","last_updated":"2025-06-03T19:26:23Z","snapshot_observed_at":"2026-08-07T11:03:26.433661Z","submitted_at":"2025-06-03T19:26:23Z","title":"Helpful Agent Meets Deceptive Judge: Understanding Vulnerabilities in Agentic Workflows","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T11:10:45.618993Z"},"links":{"citing_paper":"/paper/2506.03332"},"observation_digest":"sha256:38357fceb083a4df122046a0abd4b729afd7f8f1c16ca13c5a2fa8c913ab14be","observation_id":"78054db9-5947-4319-9573-31d6d4e47596","resolution":{"observed_at":"2026-08-07T11:10:45.618993Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.10690","last_updated":"2025-03-12T01:53:49Z","snapshot_observed_at":"2026-08-07T17:11:24.636409Z","submitted_at":"2025-03-12T01:53:49Z","title":"Battling Misinformation: An Empirical Study on Adversarial Factuality in Open-Source Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.10690","snapshot_observed_at":"2026-08-07T11:10:45.622334Z","title":"Battling misinformation: An empirical study on adversarial factuality in open-source large language models.arXiv preprint arXiv:2503.10690, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.03332","last_updated":"2025-06-03T19:26:23Z","snapshot_observed_at":"2026-08-07T11:03:26.433661Z","submitted_at":"2025-06-03T19:26:23Z","title":"Helpful Agent Meets Deceptive Judge: Understanding Vulnerabilities in Agentic Workflows","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T11:10:45.622334Z"},"links":{"cited_paper":"/paper/2503.10690","citing_paper":"/paper/2506.03332"},"observation_digest":"sha256:dff2851b0085c244e0e341da3645ef82defde5e22d9043bc8d7131af35a51576","observation_id":"41c39a13-2c28-46cd-89d4-ccd9cc75da88","resolution":{"observed_at":"2026-08-07T11:10:45.622334Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:10:46.545480Z","title":null,"venue":null,"work_id":"f5065887-abd8-43fb-90d5-c4aaeef116ea","year":2024},"citing_paper":{"arxiv_id":"2506.03332","last_updated":"2025-06-03T19:26:23Z","snapshot_observed_at":"2026-08-07T11:03:26.433661Z","submitted_at":"2025-06-03T19:26:23Z","title":"Helpful Agent Meets Deceptive Judge: Understanding Vulnerabilities in Agentic Workflows","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T11:10:45.625638Z"},"links":{"citing_paper":"/paper/2506.03332"},"observation_digest":"sha256:47c9d6f4036e9065b0b9a0db20944c1ae5aaa11f3cbb4f55af141b7e48c65fdb","observation_id":"31e67fda-94ee-45ba-bbfe-e651cdfd53fb","resolution":{"observed_at":"2026-08-07T11:10:46.553778Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:10:46.524729Z","title":"Practices for governing agentic ai systems.Research Paper, OpenAI, December, 2023","venue":null,"work_id":"b9678670-3bb3-4942-a6bb-edd4d12825c3","year":2023},"citing_paper":{"arxiv_id":"2506.03332","last_updated":"2025-06-03T19:26:23Z","snapshot_observed_at":"2026-08-07T11:03:26.433661Z","submitted_at":"2025-06-03T19:26:23Z","title":"Helpful Agent Meets Deceptive Judge: Understanding Vulnerabilities in Agentic Workflows","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T11:10:45.628595Z"},"links":{"citing_paper":"/paper/2506.03332"},"observation_digest":"sha256:5f72c0cb25b5109a7b01ce6dea4cd9d1baf316350cfadc460522a02920a1c530","observation_id":"842dfd1d-5e0f-46ac-b200-c9efd47354d8","resolution":{"observed_at":"2026-08-07T11:10:46.535097Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.11366","last_updated":"2023-10-10T05:21:45Z","snapshot_observed_at":"2026-07-06T15:05:53.556198Z","submitted_at":"2023-03-20T18:08:50Z","title":"Reflexion: Language Agents with Verbal Reinforcement Learning","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.11366","snapshot_observed_at":"2026-08-07T11:10:45.632368Z","title":"Reflexion: Language agents with verbal reinforcement learning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.03332","last_updated":"2025-06-03T19:26:23Z","snapshot_observed_at":"2026-08-07T11:03:26.433661Z","submitted_at":"2025-06-03T19:26:23Z","title":"Helpful Agent Meets Deceptive Judge: Understanding Vulnerabilities in Agentic Workflows","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T11:10:45.632368Z"},"links":{"cited_paper":"/paper/2303.11366","citing_paper":"/paper/2506.03332"},"observation_digest":"sha256:bc61eb4821e2b95dfb6743d3a280e3ccaf6bd2b34a3cf0ee178da7d1cfbb8271","observation_id":"5e5cffbc-a1a3-4d63-a9b6-61944c43f564","resolution":{"observed_at":"2026-08-07T11:10:45.632368Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:10:45.636111Z","title":"Inference scaling flaws: The limits of llm resampling with imperfect verifiers.arXiv preprint arXiv:2411.17501, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03332","last_updated":"2025-06-03T19:26:23Z","snapshot_observed_at":"2026-08-07T11:03:26.433661Z","submitted_at":"2025-06-03T19:26:23Z","title":"Helpful Agent Meets Deceptive Judge: Understanding Vulnerabilities in Agentic Workflows","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T11:10:45.636111Z"},"links":{"citing_paper":"/paper/2506.03332"},"observation_digest":"sha256:d748235916766868cde455e0cf420f3c9efe5e19b77b939d7d7a02f24f762772","observation_id":"e7aa50e3-d305-4872-9050-3b414728ed19","resolution":{"observed_at":"2026-08-07T11:10:45.636111Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.19786","last_updated":"2025-03-25T15:52:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-25T15:52:34Z","title":"Gemma 3 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.19786","snapshot_observed_at":"2026-08-07T11:10:45.639268Z","title":"Gemma 3 technical report.arXiv preprint arXiv:2503.19786, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.03332","last_updated":"2025-06-03T19:26:23Z","snapshot_observed_at":"2026-08-07T11:03:26.433661Z","submitted_at":"2025-06-03T19:26:23Z","title":"Helpful Agent Meets Deceptive Judge: Understanding Vulnerabilities in Agentic Workflows","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T11:10:45.639268Z"},"links":{"cited_paper":"/paper/2503.19786","citing_paper":"/paper/2506.03332"},"observation_digest":"sha256:b630999ea20d15bc436473a5dc8bd00851feb321b7c2243c5b11d3f602d9f1e5","observation_id":"659746c9-1a21-40c3-9810-e03b8f945461","resolution":{"observed_at":"2026-08-07T11:10:45.639268Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:10:46.504529Z","title":"An in- context learning agent for formal theorem-proving","venue":null,"work_id":"2da8fd00-ecaf-4b73-8be5-f07498672826","year":null},"citing_paper":{"arxiv_id":"2506.03332","last_updated":"2025-06-03T19:26:23Z","snapshot_observed_at":"2026-08-07T11:03:26.433661Z","submitted_at":"2025-06-03T19:26:23Z","title":"Helpful Agent Meets Deceptive Judge: Understanding Vulnerabilities in Agentic Workflows","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T11:10:45.643196Z"},"links":{"citing_paper":"/paper/2506.03332"},"observation_digest":"sha256:449447e4c549742cee1aa3a7993b03c76c9e4469aed7a6696c20e64e317e3254","observation_id":"9b1b878d-ba31-4c7f-bde1-3703747c52e4","resolution":{"observed_at":"2026-08-07T11:10:46.513148Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.19855","last_updated":"2025-03-25T17:19:38Z","snapshot_observed_at":"2026-08-07T16:37:44.743882Z","submitted_at":"2025-03-25T17:19:38Z","title":"Think Twice: Enhancing LLM Reasoning by Scaling Multi-round Test-time Thinking","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.19855","snapshot_observed_at":"2026-08-07T11:10:45.650713Z","title":"Think twice: Enhancing llm reasoning by scaling multi-round test-time thinking.arXiv preprint arXiv:2503.19855, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.03332","last_updated":"2025-06-03T19:26:23Z","snapshot_observed_at":"2026-08-07T11:03:26.433661Z","submitted_at":"2025-06-03T19:26:23Z","title":"Helpful Agent Meets Deceptive Judge: Understanding Vulnerabilities in Agentic Workflows","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T11:10:45.650713Z"},"links":{"cited_paper":"/paper/2503.19855","citing_paper":"/paper/2506.03332"},"observation_digest":"sha256:a880e97662dae0815a79a69464a99a7ef94d9c32f81f6eaad16839ec6cf4ca37","observation_id":"2c8095f3-cbcc-4b22-9706-b030bf3a72e6","resolution":{"observed_at":"2026-08-07T11:10:45.650713Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:10:45.654664Z","title":"Toward self-improvement of llms via imagination, searching, and criticizing.Advances in Neural Information Processing Systems, 37:52723–52748, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03332","last_updated":"2025-06-03T19:26:23Z","snapshot_observed_at":"2026-08-07T11:03:26.433661Z","submitted_at":"2025-06-03T19:26:23Z","title":"Helpful Agent Meets Deceptive Judge: Understanding Vulnerabilities in Agentic Workflows","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T11:10:45.654664Z"},"links":{"citing_paper":"/paper/2506.03332"},"observation_digest":"sha256:cd43a5a9d7f2df8831afa7d0f8a1f8dcfb6042da2541ec0a7dd7150338f2921e","observation_id":"df1619c1-a459-40f1-b5a0-6510583c4d5c","resolution":{"observed_at":"2026-08-07T11:10:45.654664Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1611.09830","last_updated":"2017-02-07T16:27:59Z","snapshot_observed_at":"2026-07-06T05:20:37.916333Z","submitted_at":"2016-11-29T20:38:07Z","title":"NewsQA: A Machine Comprehension Dataset","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1611.09830","snapshot_observed_at":"2026-08-07T11:10:45.657768Z","title":"Newsqa: A machine comprehension dataset.arXiv preprint arXiv:1611.09830, 2016","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2506.03332","last_updated":"2025-06-03T19:26:23Z","snapshot_observed_at":"2026-08-07T11:03:26.433661Z","submitted_at":"2025-06-03T19:26:23Z","title":"Helpful Agent Meets Deceptive Judge: Understanding Vulnerabilities in Agentic Workflows","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T11:10:45.657768Z"},"links":{"cited_paper":"/paper/1611.09830","citing_paper":"/paper/2506.03332"},"observation_digest":"sha256:e5ac2f6985bf3f49c349d955580e59b77719e399e19d52c328763535122b2ccd","observation_id":"ca280cb7-08fe-4757-b276-fb36c5ca5541","resolution":{"observed_at":"2026-08-07T11:10:45.657768Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:10:46.445717Z","title":"LEGO-prover: Neural theorem proving with growing libraries","venue":null,"work_id":"5f846c7f-e9a2-44a2-8023-f1ed92f370e6","year":2024},"citing_paper":{"arxiv_id":"2506.03332","last_updated":"2025-06-03T19:26:23Z","snapshot_observed_at":"2026-08-07T11:03:26.433661Z","submitted_at":"2025-06-03T19:26:23Z","title":"Helpful Agent Meets Deceptive Judge: Understanding Vulnerabilities in Agentic Workflows","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T11:10:45.661889Z"},"links":{"citing_paper":"/paper/2506.03332"},"observation_digest":"sha256:201695cfa4918e5605bf9bb750462b6e320bcb9d2c55846c461d2c5fee51182a","observation_id":"02705d8d-9e81-4e3e-a8e6-e51996d1acca","resolution":{"observed_at":"2026-08-07T11:10:46.462307Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.00935","last_updated":"2024-10-15T05:23:56Z","snapshot_observed_at":"2026-08-06T03:31:46.603231Z","submitted_at":"2023-10-02T06:57:45Z","title":"Resolving Knowledge Conflicts in Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.00935","snapshot_observed_at":"2026-08-07T11:10:45.665136Z","title":"Resolving knowledge conflicts in large language models.arXiv preprint arXiv:2310.00935, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.03332","last_updated":"2025-06-03T19:26:23Z","snapshot_observed_at":"2026-08-07T11:03:26.433661Z","submitted_at":"2025-06-03T19:26:23Z","title":"Helpful Agent Meets Deceptive Judge: Understanding Vulnerabilities in Agentic Workflows","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T11:10:45.665136Z"},"links":{"cited_paper":"/paper/2310.00935","citing_paper":"/paper/2506.03332"},"observation_digest":"sha256:133dab4d4537685307d2d0ce34b832533da73923a41d094ff2bec37c9984d0da","observation_id":"304c27ca-984c-4766-aaad-e5d1b58d3881","resolution":{"observed_at":"2026-08-07T11:10:45.665136Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.04368","last_updated":"2024-11-07T01:58:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-11-07T01:58:42Z","title":"Measuring short-form factuality in large language models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.04368","snapshot_observed_at":"2026-08-07T11:10:45.669134Z","title":"Measuring short-form factuality in large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03332","last_updated":"2025-06-03T19:26:23Z","snapshot_observed_at":"2026-08-07T11:03:26.433661Z","submitted_at":"2025-06-03T19:26:23Z","title":"Helpful Agent Meets Deceptive Judge: Understanding Vulnerabilities in Agentic Workflows","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T11:10:45.669134Z"},"links":{"cited_paper":"/paper/2411.04368","citing_paper":"/paper/2506.03332"},"observation_digest":"sha256:669e286234e2690331acdf13961941cdb31fba8c1a050dad3d9c8175d17d4604","observation_id":"ce2080a2-9371-4e44-8d81-267562a7ef10","resolution":{"observed_at":"2026-08-07T11:10:45.669134Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.03958","last_updated":"2024-02-15T01:03:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-07T23:48:36Z","title":"Simple synthetic data reduces sycophancy in large language models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.03958","snapshot_observed_at":"2026-08-07T11:10:45.672950Z","title":"Simple synthetic data reduces sycophancy in large language models.arXiv preprint arXiv:2308.03958, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.03332","last_updated":"2025-06-03T19:26:23Z","snapshot_observed_at":"2026-08-07T11:03:26.433661Z","submitted_at":"2025-06-03T19:26:23Z","title":"Helpful Agent Meets Deceptive Judge: Understanding Vulnerabilities in Agentic Workflows","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T11:10:45.672950Z"},"links":{"cited_paper":"/paper/2308.03958","citing_paper":"/paper/2506.03332"},"observation_digest":"sha256:8bac6fb6b6ee9acc4642b5206f661d832720d9ba498b7cec69e0429537b6c417","observation_id":"8160064c-d682-4a19-81db-c13f2bdcfb9e","resolution":{"observed_at":"2026-08-07T11:10:45.672950Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:10:46.404313Z","title":"Examining inter-consistency of large language models collaboration: An in-depth analysis via debate","venue":null,"work_id":"a6fa6c64-49be-46bc-bf00-08bf4f347fc7","year":2023},"citing_paper":{"arxiv_id":"2506.03332","last_updated":"2025-06-03T19:26:23Z","snapshot_observed_at":"2026-08-07T11:03:26.433661Z","submitted_at":"2025-06-03T19:26:23Z","title":"Helpful Agent Meets Deceptive Judge: Understanding Vulnerabilities in Agentic Workflows","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T11:10:45.676470Z"},"links":{"citing_paper":"/paper/2506.03332"},"observation_digest":"sha256:4db91f6d25255041396f17665950e83903e7dd7514d35cad973446ff02a9df39","observation_id":"257dc43e-dd17-4bd5-a5ea-9a73874ed609","resolution":{"observed_at":"2026-08-07T11:10:46.422874Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.15620","last_updated":"2025-03-19T18:09:19Z","snapshot_observed_at":"2026-08-07T16:50:53.978207Z","submitted_at":"2025-03-19T18:09:19Z","title":"Does Context Matter? ContextualJudgeBench for Evaluating LLM-based Judges in Contextual Settings","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.15620","snapshot_observed_at":"2026-08-07T11:10:45.679960Z","title":"Does context matter? contextualjudgebench for evaluating llm-based judges in contextual settings, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.03332","last_updated":"2025-06-03T19:26:23Z","snapshot_observed_at":"2026-08-07T11:03:26.433661Z","submitted_at":"2025-06-03T19:26:23Z","title":"Helpful Agent Meets Deceptive Judge: Understanding Vulnerabilities in Agentic Workflows","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T11:10:45.679960Z"},"links":{"cited_paper":"/paper/2503.15620","citing_paper":"/paper/2506.03332"},"observation_digest":"sha256:58afdf39d2d046fad7abdcedd4a1ef95d6c280941b428b8093e0c682cd18561b","observation_id":"3503e66b-4cd2-435a-bd88-7619c505b8ca","resolution":{"observed_at":"2026-08-07T11:10:45.679960Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.09085","last_updated":"2024-05-31T15:13:33Z","snapshot_observed_at":"2026-07-06T17:01:49.058644Z","submitted_at":"2023-12-14T16:16:50Z","title":"The Earth is Flat because...: Investigating LLMs' Belief towards Misinformation via Persuasive Conversation","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.09085","snapshot_observed_at":"2026-08-07T11:10:45.684166Z","title":"The earth is flat because...: Investigating llms’ belief towards misinformation via persuasive conversation.arXiv preprint arXiv:2312.09085, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.03332","last_updated":"2025-06-03T19:26:23Z","snapshot_observed_at":"2026-08-07T11:03:26.433661Z","submitted_at":"2025-06-03T19:26:23Z","title":"Helpful Agent Meets Deceptive Judge: Understanding Vulnerabilities in Agentic Workflows","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T11:10:45.684166Z"},"links":{"cited_paper":"/paper/2312.09085","citing_paper":"/paper/2506.03332"},"observation_digest":"sha256:5e707fc9af407f96886b67c7df20ec315e30ef0f09dc429aea5c26cf2d9e8bf1","observation_id":"58d5fa96-f9fb-404b-884f-7bb3d5894e24","resolution":{"observed_at":"2026-08-07T11:10:45.684166Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.08319","last_updated":"2024-06-22T08:31:40Z","snapshot_observed_at":"2026-08-04T21:59:01.328432Z","submitted_at":"2024-03-13T08:02:23Z","title":"Knowledge Conflicts for LLMs: A Survey","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.08319","snapshot_observed_at":"2026-08-07T11:10:45.688349Z","title":"Knowledge conflicts for llms: A survey.arXiv preprint arXiv:2403.08319, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03332","last_updated":"2025-06-03T19:26:23Z","snapshot_observed_at":"2026-08-07T11:03:26.433661Z","submitted_at":"2025-06-03T19:26:23Z","title":"Helpful Agent Meets Deceptive Judge: Understanding Vulnerabilities in Agentic Workflows","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T11:10:45.688349Z"},"links":{"cited_paper":"/paper/2403.08319","citing_paper":"/paper/2506.03332"},"observation_digest":"sha256:39ba80c1fdd44b333c43b2f2c046406f7cac9539b92b3832c46d93f999a86f57","observation_id":"2452f366-8686-4d5c-acce-2afacc8d01fa","resolution":{"observed_at":"2026-08-07T11:10:45.688349Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15115","snapshot_observed_at":"2026-08-07T11:10:45.691942Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03332","last_updated":"2025-06-03T19:26:23Z","snapshot_observed_at":"2026-08-07T11:03:26.433661Z","submitted_at":"2025-06-03T19:26:23Z","title":"Helpful Agent Meets Deceptive Judge: Understanding Vulnerabilities in Agentic Workflows","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T11:10:45.691942Z"},"links":{"cited_paper":"/paper/2412.15115","citing_paper":"/paper/2506.03332"},"observation_digest":"sha256:8f1d8678d32d0369341a4305ce7e4da353770d4da07c27f60727b55b3206ea58","observation_id":"03d51244-6295-4ae4-a1b1-348b5a65cd5e","resolution":{"observed_at":"2026-08-07T11:10:45.691942Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.12443","last_updated":"2022-10-21T20:08:11Z","snapshot_observed_at":"2026-07-06T13:13:37.143547Z","submitted_at":"2022-05-25T02:22:30Z","title":"Generating Natural Language Proofs with Verifier-Guided Search","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.12443","snapshot_observed_at":"2026-08-07T11:10:45.695856Z","title":"Generating natural language proofs with verifier-guided search.arXiv preprint arXiv:2205.12443, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.03332","last_updated":"2025-06-03T19:26:23Z","snapshot_observed_at":"2026-08-07T11:03:26.433661Z","submitted_at":"2025-06-03T19:26:23Z","title":"Helpful Agent Meets Deceptive Judge: Understanding Vulnerabilities in Agentic Workflows","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T11:10:45.695856Z"},"links":{"cited_paper":"/paper/2205.12443","citing_paper":"/paper/2506.03332"},"observation_digest":"sha256:6dbe91c131b1a3cdc400de3851f3d34635c8cd576cb89c42e205928a45611bc5","observation_id":"2c4865fa-1973-4da3-a5e3-4519ccad2170","resolution":{"observed_at":"2026-08-07T11:10:45.695856Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1809.09600","last_updated":"2018-09-25T17:28:20Z","snapshot_observed_at":"2026-07-31T11:19:06.421362Z","submitted_at":"2018-09-25T17:28:20Z","title":"HotpotQA: A Dataset for Diverse, Explainable Multi-hop Question Answering","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1809.09600","snapshot_observed_at":"2026-08-07T11:10:45.699426Z","title":"Hotpotqa: A dataset for diverse, explainable multi-hop question answering.arXiv preprint arXiv:1809.09600, 2018","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.03332","last_updated":"2025-06-03T19:26:23Z","snapshot_observed_at":"2026-08-07T11:03:26.433661Z","submitted_at":"2025-06-03T19:26:23Z","title":"Helpful Agent Meets Deceptive Judge: Understanding Vulnerabilities in Agentic Workflows","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-07T11:10:45.699426Z"},"links":{"cited_paper":"/paper/1809.09600","citing_paper":"/paper/2506.03332"},"observation_digest":"sha256:a6a059309c730230bac116d678110abc364a8e81df4f1825a005b73d4b47cc62","observation_id":"4df5328b-2433-4d1d-b33b-c9d76a162aa4","resolution":{"observed_at":"2026-08-07T11:10:45.699426Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:10:46.377114Z","title":"LLMCrit: Teaching large language models to use criteria","venue":null,"work_id":"c43c081f-7b8f-42f6-a83e-9c0284d2d037","year":2024},"citing_paper":{"arxiv_id":"2506.03332","last_updated":"2025-06-03T19:26:23Z","snapshot_observed_at":"2026-08-07T11:03:26.433661Z","submitted_at":"2025-06-03T19:26:23Z","title":"Helpful Agent Meets Deceptive Judge: Understanding Vulnerabilities in Agentic Workflows","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-07T11:10:45.702959Z"},"links":{"citing_paper":"/paper/2506.03332"},"observation_digest":"sha256:638b6103b7db9e1eaab6cc46383b6f41991f6f14baa81d194803e3d1c9892581","observation_id":"ee76ef9b-3d3e-4419-8144-19406373b589","resolution":{"observed_at":"2026-08-07T11:10:46.383357Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:10:45.706946Z","title":"AFlow: Automating agentic workflow generation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.03332","last_updated":"2025-06-03T19:26:23Z","snapshot_observed_at":"2026-08-07T11:03:26.433661Z","submitted_at":"2025-06-03T19:26:23Z","title":"Helpful Agent Meets Deceptive Judge: Understanding Vulnerabilities in Agentic Workflows","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-07T11:10:45.706946Z"},"links":{"citing_paper":"/paper/2506.03332"},"observation_digest":"sha256:7f4adcf2b1d1aee8ef674fea4a8c0ef03f6ed951fd7fb88dec9890858b6f3377","observation_id":"85143046-42f5-45bf-a161-4eab3dea9688","resolution":{"observed_at":"2026-08-07T11:10:45.706946Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:10:45.710982Z","title":"SituatedQA: Incorporating extra-linguistic contexts into QA","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.03332","last_updated":"2025-06-03T19:26:23Z","snapshot_observed_at":"2026-08-07T11:03:26.433661Z","submitted_at":"2025-06-03T19:26:23Z","title":"Helpful Agent Meets Deceptive Judge: Understanding Vulnerabilities in Agentic Workflows","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-07T11:10:45.710982Z"},"links":{"citing_paper":"/paper/2506.03332"},"observation_digest":"sha256:abd68ebae336dae5c880fd651f02fc28ad5cb97c960b5ee2a2c65498ad1e3654","observation_id":"83e44c2b-a4f8-483e-92bb-2e3918ca5c43","resolution":{"observed_at":"2026-08-07T11:10:45.710982Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:10:46.361400Z","title":"Position- aware attention and supervised data improve slot filling","venue":null,"work_id":"524137d5-b041-4a50-9d21-2ed04f6e09c8","year":2017},"citing_paper":{"arxiv_id":"2506.03332","last_updated":"2025-06-03T19:26:23Z","snapshot_observed_at":"2026-08-07T11:03:26.433661Z","submitted_at":"2025-06-03T19:26:23Z","title":"Helpful Agent Meets Deceptive Judge: Understanding Vulnerabilities in Agentic Workflows","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-07T11:10:45.714283Z"},"links":{"citing_paper":"/paper/2506.03332"},"observation_digest":"sha256:88fd0b71da2c8a17432f6a538f7bca0a259334bce3837cecce7f6a3674705932","observation_id":"7036bc86-9c64-44ad-9f76-3a3870d4ac62","resolution":{"observed_at":"2026-08-07T11:10:46.364770Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.14393","last_updated":"2023-10-22T19:37:06Z","snapshot_observed_at":"2026-07-06T16:36:47.091524Z","submitted_at":"2023-10-22T19:37:06Z","title":"Merging Generated and Retrieved Knowledge for Open-Domain QA","version":1},"cited_work":{"arxiv_id":"2310.14393","doi":null,"metadata_source":"pith","pith_arxiv_id":"2310.14393","snapshot_observed_at":"2026-08-07T11:10:45.805440Z","title":"Merging Generated and Retrieved Knowledge for Open-Domain QA","venue":"cs.CL","work_id":"42bc34c1-815e-4454-bdc2-58171192511d","year":2023},"citing_paper":{"arxiv_id":"2506.03332","last_updated":"2025-06-03T19:26:23Z","snapshot_observed_at":"2026-08-07T11:03:26.433661Z","submitted_at":"2025-06-03T19:26:23Z","title":"Helpful Agent Meets Deceptive Judge: Understanding Vulnerabilities in Agentic Workflows","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-07T11:10:45.717582Z"},"links":{"cited_paper":"/paper/2310.14393","citing_paper":"/paper/2506.03332"},"observation_digest":"sha256:b10d964edb940bbb7fc38def91c214d37983b1c28fd27f5e414311baa42cd382","observation_id":"9dc70918-abe1-4e64-99f7-dbe0d6ade062","resolution":{"observed_at":"2026-08-07T11:10:45.811721Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:10:46.352275Z","title":null,"venue":null,"work_id":"712347ec-c0e5-4c9f-915f-8d19b1a14369","year":null},"citing_paper":{"arxiv_id":"2506.03332","last_updated":"2025-06-03T19:26:23Z","snapshot_observed_at":"2026-08-07T11:03:26.433661Z","submitted_at":"2025-06-03T19:26:23Z","title":"Helpful Agent Meets Deceptive Judge: Understanding Vulnerabilities in Agentic Workflows","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-07T11:10:45.722403Z"},"links":{"citing_paper":"/paper/2506.03332"},"observation_digest":"sha256:c2091c10ba7510dee45d46b130c8f13f25698ace85ed73a38076ef12d0ae3d76","observation_id":"fb463a37-ff55-4bdb-8faa-15fda3878e57","resolution":{"observed_at":"2026-08-07T11:10:46.355427Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:10:46.343025Z","title":null,"venue":null,"work_id":"c98e92c7-0295-4d20-8ec7-7bb395e3179c","year":null},"citing_paper":{"arxiv_id":"2506.03332","last_updated":"2025-06-03T19:26:23Z","snapshot_observed_at":"2026-08-07T11:03:26.433661Z","submitted_at":"2025-06-03T19:26:23Z","title":"Helpful Agent Meets Deceptive Judge: Understanding Vulnerabilities in Agentic Workflows","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-07T11:10:45.725664Z"},"links":{"citing_paper":"/paper/2506.03332"},"observation_digest":"sha256:57485e8be179a8e90a027e28ce441a6c0bc6325d627d028e6cd10346fc688e04","observation_id":"ee76e201-3308-4478-ad17-b3b5c3a75b4e","resolution":{"observed_at":"2026-08-07T11:10:46.346548Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:10:46.333018Z","title":"studies” or “statistics","venue":null,"work_id":"8858d8e9-9983-4e8a-b986-6c0738fc40eb","year":null},"citing_paper":{"arxiv_id":"2506.03332","last_updated":"2025-06-03T19:26:23Z","snapshot_observed_at":"2026-08-07T11:03:26.433661Z","submitted_at":"2025-06-03T19:26:23Z","title":"Helpful Agent Meets Deceptive Judge: Understanding Vulnerabilities in Agentic Workflows","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-07T11:10:45.729976Z"},"links":{"citing_paper":"/paper/2506.03332"},"observation_digest":"sha256:b99a46250f239f74806e87cb146419f3145ed2e586ae1938b819ecefbec2d016","observation_id":"572d83ec-8ba1-4651-90bf-354c801e2a6b","resolution":{"observed_at":"2026-08-07T11:10:46.336953Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:10:46.323201Z","title":null,"venue":null,"work_id":"342b4afd-4a4a-48aa-b650-1c2193a084b3","year":null},"citing_paper":{"arxiv_id":"2506.03332","last_updated":"2025-06-03T19:26:23Z","snapshot_observed_at":"2026-08-07T11:03:26.433661Z","submitted_at":"2025-06-03T19:26:23Z","title":"Helpful Agent Meets Deceptive Judge: Understanding Vulnerabilities in Agentic Workflows","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-07T11:10:45.734594Z"},"links":{"citing_paper":"/paper/2506.03332"},"observation_digest":"sha256:778b7ec217a6d5a3eaf4893c0f9f060511c9d416ea376dc06abf6fe58903a086","observation_id":"035fbc01-6134-4025-922f-234761dc69a8","resolution":{"observed_at":"2026-08-07T11:10:46.326832Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:10:46.313292Z","title":"expert opinions","venue":null,"work_id":"208ad94a-bfed-4d97-bab6-e97d68b2c16f","year":null},"citing_paper":{"arxiv_id":"2506.03332","last_updated":"2025-06-03T19:26:23Z","snapshot_observed_at":"2026-08-07T11:03:26.433661Z","submitted_at":"2025-06-03T19:26:23Z","title":"Helpful Agent Meets Deceptive Judge: Understanding Vulnerabilities in Agentic Workflows","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-07T11:10:45.738482Z"},"links":{"citing_paper":"/paper/2506.03332"},"observation_digest":"sha256:fe751a794c6d601a162c7b13ab56f7886980ee1c4a75517cda14fec02d67398a","observation_id":"4d7d511f-fe48-42b9-b46d-cb6b044086aa","resolution":{"observed_at":"2026-08-07T11:10:46.316400Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:10:46.303718Z","title":null,"venue":null,"work_id":"0d8bb175-15b4-424b-a82c-aa7296643a64","year":null},"citing_paper":{"arxiv_id":"2506.03332","last_updated":"2025-06-03T19:26:23Z","snapshot_observed_at":"2026-08-07T11:03:26.433661Z","submitted_at":"2025-06-03T19:26:23Z","title":"Helpful Agent Meets Deceptive Judge: Understanding Vulnerabilities in Agentic Workflows","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-07T11:10:45.741757Z"},"links":{"citing_paper":"/paper/2506.03332"},"observation_digest":"sha256:ffed5274b7f947b4cc6b88ace683e135652980d99cc6ad06428ebf3e907f3bc0","observation_id":"10b453a9-9b0f-49ce-820a-680c620ab5b3","resolution":{"observed_at":"2026-08-07T11:10:46.307058Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:10:46.293968Z","title":null,"venue":null,"work_id":"f983d23a-deab-4589-8de1-4c70dfeab31e","year":null},"citing_paper":{"arxiv_id":"2506.03332","last_updated":"2025-06-03T19:26:23Z","snapshot_observed_at":"2026-08-07T11:03:26.433661Z","submitted_at":"2025-06-03T19:26:23Z","title":"Helpful Agent Meets Deceptive Judge: Understanding Vulnerabilities in Agentic Workflows","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-07T11:10:45.745532Z"},"links":{"citing_paper":"/paper/2506.03332"},"observation_digest":"sha256:ad879366734e0a760eb423d14594ef28f5e0ea033ca7f9180b852c73d95f6b10","observation_id":"876b9632-643b-4d15-9a95-236dea98d87f","resolution":{"observed_at":"2026-08-07T11:10:46.297727Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:10:46.284369Z","title":null,"venue":null,"work_id":"72ef313b-3dd0-4787-8b4b-4188cc031084","year":null},"citing_paper":{"arxiv_id":"2506.03332","last_updated":"2025-06-03T19:26:23Z","snapshot_observed_at":"2026-08-07T11:03:26.433661Z","submitted_at":"2025-06-03T19:26:23Z","title":"Helpful Agent Meets Deceptive Judge: Understanding Vulnerabilities in Agentic Workflows","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-07T11:10:45.749904Z"},"links":{"citing_paper":"/paper/2506.03332"},"observation_digest":"sha256:ed526da1b996f5000bc7149f4282076a54b4afb7a44006f22fa70c56eacf4b6e","observation_id":"abeea410-1d77-4113-921e-e055787fb5c6","resolution":{"observed_at":"2026-08-07T11:10:46.287737Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:10:46.273313Z","title":"Be creative and ruthless in your criticism","venue":null,"work_id":"fa4e1567-dc48-4bcd-b71f-6f27fb68eb75","year":null},"citing_paper":{"arxiv_id":"2506.03332","last_updated":"2025-06-03T19:26:23Z","snapshot_observed_at":"2026-08-07T11:03:26.433661Z","submitted_at":"2025-06-03T19:26:23Z","title":"Helpful Agent Meets Deceptive Judge: Understanding Vulnerabilities in Agentic Workflows","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-07T11:10:45.753651Z"},"links":{"citing_paper":"/paper/2506.03332"},"observation_digest":"sha256:c14ea3f1cd314e9ab05ec149c40b10e341d188eb2ed677b519155582e26728d8","observation_id":"9e052475-cf78-4112-8276-42ded6e7cda6","resolution":{"observed_at":"2026-08-07T11:10:46.277779Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:10:46.262970Z","title":"Are you sure about this? I don’t think this answer is correct because","venue":null,"work_id":"08306005-cf91-4dbd-876b-730385ed3fbb","year":null},"citing_paper":{"arxiv_id":"2506.03332","last_updated":"2025-06-03T19:26:23Z","snapshot_observed_at":"2026-08-07T11:03:26.433661Z","submitted_at":"2025-06-03T19:26:23Z","title":"Helpful Agent Meets Deceptive Judge: Understanding Vulnerabilities in Agentic Workflows","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-07T11:10:45.756990Z"},"links":{"citing_paper":"/paper/2506.03332"},"observation_digest":"sha256:3067458206173f7847c2c70af9cb615e98621d404f8f263076c3f57a76f45613","observation_id":"a6288341-3502-4487-97de-6f57e5dd6779","resolution":{"observed_at":"2026-08-07T11:10:46.266954Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:10:46.252069Z","title":"This conclusion seems hasty. What if","venue":null,"work_id":"024ad17f-35ae-4934-a9aa-a5db25432503","year":null},"citing_paper":{"arxiv_id":"2506.03332","last_updated":"2025-06-03T19:26:23Z","snapshot_observed_at":"2026-08-07T11:03:26.433661Z","submitted_at":"2025-06-03T19:26:23Z","title":"Helpful Agent Meets Deceptive Judge: Understanding Vulnerabilities in Agentic Workflows","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-07T11:10:45.760176Z"},"links":{"citing_paper":"/paper/2506.03332"},"observation_digest":"sha256:6016f6c76cbd08fe3047eef8b542f379658480b1b918b0d1229e107c2db854c8","observation_id":"a240727e-2006-44d5-9ecd-1242c28fe83e","resolution":{"observed_at":"2026-08-07T11:10:46.256950Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:10:46.241616Z","title":"I don’t think this follows logically because","venue":null,"work_id":"e6067b22-e92d-4edb-9f4e-96ca1b5e8d6d","year":null},"citing_paper":{"arxiv_id":"2506.03332","last_updated":"2025-06-03T19:26:23Z","snapshot_observed_at":"2026-08-07T11:03:26.433661Z","submitted_at":"2025-06-03T19:26:23Z","title":"Helpful Agent Meets Deceptive Judge: Understanding Vulnerabilities in Agentic Workflows","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-07T11:10:45.763239Z"},"links":{"citing_paper":"/paper/2506.03332"},"observation_digest":"sha256:cce442e0c6e85f7986e5da6f33afb0e9643d92fec6776bd1f2ffa822ecdb4001","observation_id":"bffffb8b-2a6b-4d8d-a43b-f864042d6cca","resolution":{"observed_at":"2026-08-07T11:10:46.245063Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:10:46.231708Z","title":null,"venue":null,"work_id":"210e3a12-fc37-4146-b60a-7f825cbc044f","year":null},"citing_paper":{"arxiv_id":"2506.03332","last_updated":"2025-06-03T19:26:23Z","snapshot_observed_at":"2026-08-07T11:03:26.433661Z","submitted_at":"2025-06-03T19:26:23Z","title":"Helpful Agent Meets Deceptive Judge: Understanding Vulnerabilities in Agentic Workflows","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-07T11:10:45.767347Z"},"links":{"citing_paper":"/paper/2506.03332"},"observation_digest":"sha256:57fb50521eaa0ab3470f94df943d5d70c7f8b2a91d959590492a660687ad1edf","observation_id":"5eb77fa0-ba39-4b9c-a33d-d088f8b89736","resolution":{"observed_at":"2026-08-07T11:10:46.235130Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:10:46.484253Z","title":null,"venue":null,"work_id":"4669eeee-6185-4c1d-80ad-3d54bea85d73","year":null},"citing_paper":{"arxiv_id":"2506.03332","last_updated":"2025-06-03T19:26:23Z","snapshot_observed_at":"2026-08-07T11:03:26.433661Z","submitted_at":"2025-06-03T19:26:23Z","title":"Helpful Agent Meets Deceptive Judge: Understanding Vulnerabilities in Agentic Workflows","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-07T11:10:45.647597Z"},"links":{"citing_paper":"/paper/2506.03332"},"observation_digest":"sha256:aca9bd453f332966fba289a092c9aa25e86acc59e519e5306241b5358ec5d8df","observation_id":"8e63d4c5-bcba-478c-b046-9e21234a13b8","resolution":{"observed_at":"2026-08-07T11:10:46.492842Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.03332","last_updated":"2025-06-03T19:26:23Z","latest_version":1,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-07T11:03:26.433661Z","submitted_at":"2025-06-03T19:26:23Z","title":"Helpful Agent Meets Deceptive Judge: Understanding Vulnerabilities in Agentic Workflows"},"reference_resolution":{"displayed":70,"state_counts":{"malformed_identifier":1,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":47,"verified_exact":0,"verified_fuzzy":21},"total_outbound_references":70},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 70 of 70 outbound references and 2 inbound Pith citation observations for arXiv:2506.03332."}