{"as_of":"2026-08-10T06:19:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:0b8005d423fc737409f5910086cca210c9bb69b32e0e048a21cdd1a99bf0384e","coverage":[{"denominator":57,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":57,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T12:46:13.419971Z","state":"measured"},{"denominator":59,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":59,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-26T04:07:14.506108Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T14:19:54.263373Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.23634","last_updated":"2025-05-29T16:44:29Z","snapshot_observed_at":"2026-08-09T15:33:48.720032Z","submitted_at":"2025-05-29T16:44:29Z","title":"MCP Safety Training: Learning to Refuse Falsely Benign MCP Exploits using Improved Preference Alignment","version":1},"cited_work":{"arxiv_id":"2505.23634","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.23634","snapshot_observed_at":"2026-07-04T14:19:54.263373Z","title":null,"venue":null,"work_id":"9fe3f254-9803-4da4-963b-b22cc82f075a","year":2025},"citing_paper":{"arxiv_id":"2512.06556","last_updated":"2026-05-21T13:44:50Z","snapshot_observed_at":"2026-07-06T22:37:59.340166Z","submitted_at":"2025-12-06T20:07:58Z","title":"Semantic Attacks on Tool-Augmented LLMs: Securing the Model Context Protocol Against Descriptor-Level Manipulation","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-22T12:46:44.819224Z"},"links":{"cited_paper":"/paper/2505.23634","citing_paper":"/paper/2512.06556"},"observation_digest":"sha256:0d2ad91de729b739a163cea5489bd0def5c1b2588a61533954e66cfe6491492d","observation_id":"da564c3b-f022-4744-996e-223eb10a2142","resolution":{"observed_at":"2026-05-22T12:51:33.414770Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23634","last_updated":"2025-05-29T16:44:29Z","snapshot_observed_at":"2026-08-09T15:33:48.720032Z","submitted_at":"2025-05-29T16:44:29Z","title":"MCP Safety Training: Learning to Refuse Falsely Benign MCP Exploits using Improved Preference Alignment","version":1},"cited_work":{"arxiv_id":"2505.23634","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.23634","snapshot_observed_at":"2026-07-04T14:19:54.263373Z","title":null,"venue":null,"work_id":"9fe3f254-9803-4da4-963b-b22cc82f075a","year":2025},"citing_paper":{"arxiv_id":"2606.27027","last_updated":"2026-06-25T13:35:28Z","snapshot_observed_at":"2026-08-07T13:33:16.881427Z","submitted_at":"2026-06-25T13:35:28Z","title":"ShareLock: A Stealthy Multi-Tool Threshold Poisoning Attack Against MCP","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-06-26T04:07:14.506108Z"},"links":{"cited_paper":"/paper/2505.23634","citing_paper":"/paper/2606.27027"},"observation_digest":"sha256:8982623b88cbb9b79d487139acdae596f9b7f20dd768a0034277da678237b6c3","observation_id":"3c7690e5-6140-47bd-ab3f-451bc27b17d1","resolution":{"observed_at":"2026-07-04T14:19:54.264995Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2505.23634/citation-record","integrity":"/paper/2505.23634/integrity","json":"/paper/2505.23634/citation-record.json","paper":"/paper/2505.23634"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:46:19.978829Z","title":"Introducing Llama 3.1: Our most capable models to date","venue":null,"work_id":"9c94d365-2790-4403-98d0-f7b5c7636c54","year":2024},"citing_paper":{"arxiv_id":"2505.23634","last_updated":"2025-05-29T16:44:29Z","snapshot_observed_at":"2026-08-09T15:33:48.720032Z","submitted_at":"2025-05-29T16:44:29Z","title":"MCP Safety Training: Learning to Refuse Falsely Benign MCP Exploits using Improved Preference Alignment","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T12:46:09.791580Z"},"links":{"citing_paper":"/paper/2505.23634"},"observation_digest":"sha256:b8619b8617becf3bd45c53718c474b7a99539e2c93fcb981ec30084ae77e29e6","observation_id":"671e29bc-86ad-42e2-91a1-fc884f86cfa1","resolution":{"observed_at":"2026-08-07T12:46:20.102524Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:46:19.742709Z","title":"Rag llms are not safer: A safety analysis of retrieval-augmented generation for large language models","venue":null,"work_id":"c9597068-3aa8-4e3d-adf8-d350f52a9122","year":2025},"citing_paper":{"arxiv_id":"2505.23634","last_updated":"2025-05-29T16:44:29Z","snapshot_observed_at":"2026-08-09T15:33:48.720032Z","submitted_at":"2025-05-29T16:44:29Z","title":"MCP Safety Training: Learning to Refuse Falsely Benign MCP Exploits using Improved Preference Alignment","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T12:46:09.842283Z"},"links":{"citing_paper":"/paper/2505.23634"},"observation_digest":"sha256:f7e468f68e309addcbca08df9389d42c191af7f2d239d25c6c5d8e9212c2c248","observation_id":"7ff0a099-648f-427e-b7d1-1e1757b0c8d5","resolution":{"observed_at":"2026-08-07T12:46:19.845591Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:46:19.533273Z","title":"Prevention of phishing attacks using ai-based cybersecurity awareness training","venue":null,"work_id":"ef53b6b6-f083-41dd-9ce7-4565d562bda4","year":2022},"citing_paper":{"arxiv_id":"2505.23634","last_updated":"2025-05-29T16:44:29Z","snapshot_observed_at":"2026-08-09T15:33:48.720032Z","submitted_at":"2025-05-29T16:44:29Z","title":"MCP Safety Training: Learning to Refuse Falsely Benign MCP Exploits using Improved Preference Alignment","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T12:46:09.909597Z"},"links":{"citing_paper":"/paper/2505.23634"},"observation_digest":"sha256:cd5193a3b796fc835ed79d77e493c91e4a51fbbf202acca4a20b7042c4809319","observation_id":"2d05308d-25ef-40c9-9ba3-ab646b7d5883","resolution":{"observed_at":"2026-08-07T12:46:19.610683Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:46:19.273653Z","title":"https://github.com/modelcontextprotocol/servers/tree/main/src/ filesystem","venue":null,"work_id":"ada3a36d-3dfb-4ad7-ad50-c491dea0aada","year":2025},"citing_paper":{"arxiv_id":"2505.23634","last_updated":"2025-05-29T16:44:29Z","snapshot_observed_at":"2026-08-09T15:33:48.720032Z","submitted_at":"2025-05-29T16:44:29Z","title":"MCP Safety Training: Learning to Refuse Falsely Benign MCP Exploits using Improved Preference Alignment","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T12:46:09.970125Z"},"links":{"citing_paper":"/paper/2505.23634"},"observation_digest":"sha256:ca932e4ccea84cd37b78cf0d19cf4479567dfb7a3755d85a00857e634ec3be87","observation_id":"54c0f9eb-5332-47e9-aad3-d38170a1b7d4","resolution":{"observed_at":"2026-08-07T12:46:19.403589Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:46:19.045709Z","title":"https://www.anthropic.com/news/ model-context-protocol","venue":null,"work_id":"28054efe-f634-4b98-994f-38311d146e20","year":2025},"citing_paper":{"arxiv_id":"2505.23634","last_updated":"2025-05-29T16:44:29Z","snapshot_observed_at":"2026-08-09T15:33:48.720032Z","submitted_at":"2025-05-29T16:44:29Z","title":"MCP Safety Training: Learning to Refuse Falsely Benign MCP Exploits using Improved Preference Alignment","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T12:46:10.015124Z"},"links":{"citing_paper":"/paper/2505.23634"},"observation_digest":"sha256:37cabc26e96b542d98a2e6d15eff778f4746bbd90605ed1e4320932244cd7211","observation_id":"3d7ae738-b312-4711-b1d3-0c4da63ec4f3","resolution":{"observed_at":"2026-08-07T12:46:19.177230Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:46:18.807721Z","title":"https://modelcontextprotocol.io/ quickstart/user","venue":null,"work_id":"a29ab3af-3faf-4cf9-9545-92dece046ab3","year":2025},"citing_paper":{"arxiv_id":"2505.23634","last_updated":"2025-05-29T16:44:29Z","snapshot_observed_at":"2026-08-09T15:33:48.720032Z","submitted_at":"2025-05-29T16:44:29Z","title":"MCP Safety Training: Learning to Refuse Falsely Benign MCP Exploits using Improved Preference Alignment","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T12:46:10.068904Z"},"links":{"citing_paper":"/paper/2505.23634"},"observation_digest":"sha256:dbb535833cd596812562e7c0084ef41a7e1d717e536c3aadaebc704c1d31aa68","observation_id":"a97d9439-8627-4130-a0c1-9151452f5b31","resolution":{"observed_at":"2026-08-07T12:46:18.917252Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:46:18.592740Z","title":"https://github.com/modelcontextprotocol/servers/tree/ main/src/slack","venue":null,"work_id":"28bbdb24-32cc-4a4b-8db8-e82e58e16f5d","year":2025},"citing_paper":{"arxiv_id":"2505.23634","last_updated":"2025-05-29T16:44:29Z","snapshot_observed_at":"2026-08-09T15:33:48.720032Z","submitted_at":"2025-05-29T16:44:29Z","title":"MCP Safety Training: Learning to Refuse Falsely Benign MCP Exploits using Improved Preference Alignment","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T12:46:10.139452Z"},"links":{"citing_paper":"/paper/2505.23634"},"observation_digest":"sha256:3084c72a6cfef5c0fa393f9c532a92f5a1222cdf40c9a25adeeb382c175a934e","observation_id":"32f90456-a270-4c20-b5da-6bb0765dcc78","resolution":{"observed_at":"2026-08-07T12:46:18.692148Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:46:18.376932Z","title":"Refusal in language models is mediated by a single direction","venue":null,"work_id":"fb368a7b-586f-4920-88cd-ebcd424fdf17","year":2024},"citing_paper":{"arxiv_id":"2505.23634","last_updated":"2025-05-29T16:44:29Z","snapshot_observed_at":"2026-08-09T15:33:48.720032Z","submitted_at":"2025-05-29T16:44:29Z","title":"MCP Safety Training: Learning to Refuse Falsely Benign MCP Exploits using Improved Preference Alignment","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T12:46:10.206387Z"},"links":{"citing_paper":"/paper/2505.23634"},"observation_digest":"sha256:5e35078ddf26df9a2cf4915102e6f97aa449c2c1337a4d6e7bad3da8a26129f1","observation_id":"87700fde-fd28-46cc-a3cc-893aa3a0a875","resolution":{"observed_at":"2026-08-07T12:46:18.478345Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.04724","last_updated":"2023-12-07T22:07:54Z","snapshot_observed_at":"2026-08-09T23:28:16.743355Z","submitted_at":"2023-12-07T22:07:54Z","title":"Purple Llama CyberSecEval: A Secure Coding Benchmark for Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.04724","snapshot_observed_at":"2026-08-07T12:46:10.267103Z","title":"Purple llama cyberseceval: A secure coding benchmark for language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.23634","last_updated":"2025-05-29T16:44:29Z","snapshot_observed_at":"2026-08-09T15:33:48.720032Z","submitted_at":"2025-05-29T16:44:29Z","title":"MCP Safety Training: Learning to Refuse Falsely Benign MCP Exploits using Improved Preference Alignment","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T12:46:10.267103Z"},"links":{"cited_paper":"/paper/2312.04724","citing_paper":"/paper/2505.23634"},"observation_digest":"sha256:ce633f15478e5d2d6946fbeac3bec2a74f57d244324849c7581653986b0c478a","observation_id":"6f606523-bef9-46e5-b411-10bf0bb1bb23","resolution":{"observed_at":"2026-08-07T12:46:10.267103Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:46:10.329051Z","title":"Jailbreakbench: An open robustness benchmark for jailbreaking large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23634","last_updated":"2025-05-29T16:44:29Z","snapshot_observed_at":"2026-08-09T15:33:48.720032Z","submitted_at":"2025-05-29T16:44:29Z","title":"MCP Safety Training: Learning to Refuse Falsely Benign MCP Exploits using Improved Preference Alignment","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T12:46:10.329051Z"},"links":{"citing_paper":"/paper/2505.23634"},"observation_digest":"sha256:3ec5ab1cd40911529e7834ac147afccbc283b61664536895e3739939bbb72db1","observation_id":"ca25b692-4593-4d69-bef2-659696240b82","resolution":{"observed_at":"2026-08-07T12:46:10.329051Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:46:18.108444Z","title":"https://huggingface. co/blog/tiny-agents","venue":null,"work_id":"c087dd0d-51bf-4063-8aa9-a22d59bbec0d","year":2025},"citing_paper":{"arxiv_id":"2505.23634","last_updated":"2025-05-29T16:44:29Z","snapshot_observed_at":"2026-08-09T15:33:48.720032Z","submitted_at":"2025-05-29T16:44:29Z","title":"MCP Safety Training: Learning to Refuse Falsely Benign MCP Exploits using Improved Preference Alignment","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T12:46:10.411051Z"},"links":{"citing_paper":"/paper/2505.23634"},"observation_digest":"sha256:e95ab2e42a6587eb157c003eb22a5b8ebf13f742fb020ea895761f554c4001c4","observation_id":"312653a8-443a-4dd9-b113-0255761d7732","resolution":{"observed_at":"2026-08-07T12:46:18.224360Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:46:17.908079Z","title":"Noise contrastive alignment of language models with explicit rewards","venue":null,"work_id":"00017e41-46ef-4e21-8717-f803f1d73b86","year":null},"citing_paper":{"arxiv_id":"2505.23634","last_updated":"2025-05-29T16:44:29Z","snapshot_observed_at":"2026-08-09T15:33:48.720032Z","submitted_at":"2025-05-29T16:44:29Z","title":"MCP Safety Training: Learning to Refuse Falsely Benign MCP Exploits using Improved Preference Alignment","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T12:46:10.462008Z"},"links":{"citing_paper":"/paper/2505.23634"},"observation_digest":"sha256:cd5b70401798720c6f690aa67254e56b379eb3b41ca5fe003a4e86e37288ca35","observation_id":"1df122ca-41f1-48a8-b416-d46016890161","resolution":{"observed_at":"2026-08-07T12:46:18.013463Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.03574","last_updated":"2025-05-06T14:34:21Z","snapshot_observed_at":"2026-08-07T15:49:30.311074Z","submitted_at":"2025-05-06T14:34:21Z","title":"LlamaFirewall: An open source guardrail system for building secure AI agents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.03574","snapshot_observed_at":"2026-08-07T12:46:10.513486Z","title":"Llamafirewall: An open source guardrail system for building secure ai agents","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.23634","last_updated":"2025-05-29T16:44:29Z","snapshot_observed_at":"2026-08-09T15:33:48.720032Z","submitted_at":"2025-05-29T16:44:29Z","title":"MCP Safety Training: Learning to Refuse Falsely Benign MCP Exploits using Improved Preference Alignment","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T12:46:10.513486Z"},"links":{"cited_paper":"/paper/2505.03574","citing_paper":"/paper/2505.23634"},"observation_digest":"sha256:521ae136575987595e64b8fadc225d16d69a029590ec132ed097579213456737","observation_id":"a8eba86a-ec78-4124-a353-9a08efe23cd6","resolution":{"observed_at":"2026-08-07T12:46:10.513486Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:46:17.672016Z","title":"Provably robust dpo: Aligning language models with noisy feedback","venue":null,"work_id":"b0c83d0d-e85a-49c8-b344-d3f3af96d2e3","year":null},"citing_paper":{"arxiv_id":"2505.23634","last_updated":"2025-05-29T16:44:29Z","snapshot_observed_at":"2026-08-09T15:33:48.720032Z","submitted_at":"2025-05-29T16:44:29Z","title":"MCP Safety Training: Learning to Refuse Falsely Benign MCP Exploits using Improved Preference Alignment","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T12:46:10.580264Z"},"links":{"citing_paper":"/paper/2505.23634"},"observation_digest":"sha256:4cd1be72427318a58c6b7acfa298ec09c33f24e3781d4df0e047228f4afa57ff","observation_id":"fbc81090-ee0b-4085-a7cc-d4ff097b0f6e","resolution":{"observed_at":"2026-08-07T12:46:17.756514Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2110.14168","last_updated":"2021-11-18T00:23:45Z","snapshot_observed_at":"2026-08-07T01:45:38.840969Z","submitted_at":"2021-10-27T04:49:45Z","title":"Training Verifiers to Solve Math Word Problems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.14168","snapshot_observed_at":"2026-08-07T12:46:10.643287Z","title":"Training verifiers to solve math word problems","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.23634","last_updated":"2025-05-29T16:44:29Z","snapshot_observed_at":"2026-08-09T15:33:48.720032Z","submitted_at":"2025-05-29T16:44:29Z","title":"MCP Safety Training: Learning to Refuse Falsely Benign MCP Exploits using Improved Preference Alignment","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T12:46:10.643287Z"},"links":{"cited_paper":"/paper/2110.14168","citing_paper":"/paper/2505.23634"},"observation_digest":"sha256:afd18fbd1c561e92a57f51c557a01dba75701dad72136b6fccd521efd87816d6","observation_id":"6adb2bbc-9dd8-4a9e-825b-60c9892be713","resolution":{"observed_at":"2026-08-07T12:46:10.643287Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:46:17.518545Z","title":"Agentdojo: A dynamic environment to evaluate prompt injection attacks and defenses for llm agents","venue":null,"work_id":"44478c3b-cbeb-4ab1-b4c7-ea5a14fcdda4","year":2024},"citing_paper":{"arxiv_id":"2505.23634","last_updated":"2025-05-29T16:44:29Z","snapshot_observed_at":"2026-08-09T15:33:48.720032Z","submitted_at":"2025-05-29T16:44:29Z","title":"MCP Safety Training: Learning to Refuse Falsely Benign MCP Exploits using Improved Preference Alignment","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T12:46:10.703191Z"},"links":{"citing_paper":"/paper/2505.23634"},"observation_digest":"sha256:4ea259b84d444c1e847c614f0f94b7321a4c23de398974ae2c6a3f52a28a4e3c","observation_id":"ebbe78f4-d0e8-4d45-8a1e-174e8b8c769e","resolution":{"observed_at":"2026-08-07T12:46:17.580928Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-07T12:46:10.767186Z","title":"Deepseek-r1: Incentivizing reasoning capability in llms via reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.23634","last_updated":"2025-05-29T16:44:29Z","snapshot_observed_at":"2026-08-09T15:33:48.720032Z","submitted_at":"2025-05-29T16:44:29Z","title":"MCP Safety Training: Learning to Refuse Falsely Benign MCP Exploits using Improved Preference Alignment","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T12:46:10.767186Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2505.23634"},"observation_digest":"sha256:b1522a7e798c9e39a4c33dbd3cad7201207d5c12e0db2b367b67b425b026c7e1","observation_id":"c2620ed5-0333-4f0c-a85d-95065cb915dc","resolution":{"observed_at":"2026-08-07T12:46:10.767186Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:46:10.832715Z","title":"Qlora: Efficient finetuning of quantized llms","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.23634","last_updated":"2025-05-29T16:44:29Z","snapshot_observed_at":"2026-08-09T15:33:48.720032Z","submitted_at":"2025-05-29T16:44:29Z","title":"MCP Safety Training: Learning to Refuse Falsely Benign MCP Exploits using Improved Preference Alignment","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T12:46:10.832715Z"},"links":{"citing_paper":"/paper/2505.23634"},"observation_digest":"sha256:1abebd2177b34f76e809f26d2dc7f3feee639a8a283f95b81e5fd5d0f25974a8","observation_id":"e6676746-962a-48dc-8926-b298d1c2ec48","resolution":{"observed_at":"2026-08-07T12:46:10.832715Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:46:17.289902Z","title":"Anchored preference optimization and contrastive revisions: Addressing underspecification in alignment","venue":null,"work_id":"30934c34-fc00-4385-85d2-c64c0bdead2d","year":2025},"citing_paper":{"arxiv_id":"2505.23634","last_updated":"2025-05-29T16:44:29Z","snapshot_observed_at":"2026-08-09T15:33:48.720032Z","submitted_at":"2025-05-29T16:44:29Z","title":"MCP Safety Training: Learning to Refuse Falsely Benign MCP Exploits using Improved Preference Alignment","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T12:46:10.882235Z"},"links":{"citing_paper":"/paper/2505.23634"},"observation_digest":"sha256:9e91b10f910665b18ce14eceefcde5b5dca16a674cbb12bedc4d7d2ac4ff5f38","observation_id":"d574582c-e5e8-4613-8fdd-7b71b11fcc02","resolution":{"observed_at":"2026-08-07T12:46:17.413758Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:46:17.079443Z","title":"https://cloud.google.com/blog/products/ai-machine-learning/ build-multilingual-chatbots-with-gemini-gemma-and-mcp","venue":null,"work_id":"ce8fbc27-deaf-48b2-abfd-3fe20ef7b674","year":2025},"citing_paper":{"arxiv_id":"2505.23634","last_updated":"2025-05-29T16:44:29Z","snapshot_observed_at":"2026-08-09T15:33:48.720032Z","submitted_at":"2025-05-29T16:44:29Z","title":"MCP Safety Training: Learning to Refuse Falsely Benign MCP Exploits using Improved Preference Alignment","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T12:46:10.966477Z"},"links":{"citing_paper":"/paper/2505.23634"},"observation_digest":"sha256:81359a476b98d08a535a76e2bb5586ace731d5dd899268d8c9b604aa545e3542","observation_id":"a96694de-41fa-4f19-924a-b6913f14b121","resolution":{"observed_at":"2026-08-07T12:46:17.152964Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:46:16.872577Z","title":"https://cloud.google.com/blog/products/ai-machine-learning/ mcp-toolbox-for-databases-now-supports-model-context-protocol","venue":null,"work_id":"badf5b1c-0374-434c-ab88-e80658d83079","year":2025},"citing_paper":{"arxiv_id":"2505.23634","last_updated":"2025-05-29T16:44:29Z","snapshot_observed_at":"2026-08-09T15:33:48.720032Z","submitted_at":"2025-05-29T16:44:29Z","title":"MCP Safety Training: Learning to Refuse Falsely Benign MCP Exploits using Improved Preference Alignment","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T12:46:11.278952Z"},"links":{"citing_paper":"/paper/2505.23634"},"observation_digest":"sha256:5140f30924393388b0206f99ff16fae7a83c35718b15d9d4497b1d87dd683bea","observation_id":"b6f22118-a953-488a-bb98-047186884329","resolution":{"observed_at":"2026-08-07T12:46:16.940197Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-07T12:46:11.342818Z","title":"The llama 3 herd of models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23634","last_updated":"2025-05-29T16:44:29Z","snapshot_observed_at":"2026-08-09T15:33:48.720032Z","submitted_at":"2025-05-29T16:44:29Z","title":"MCP Safety Training: Learning to Refuse Falsely Benign MCP Exploits using Improved Preference Alignment","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T12:46:11.342818Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2505.23634"},"observation_digest":"sha256:3f3db470bd1234be56cf7a06f72386c2588f29cb66e474cfa8d465bd738e0fc4","observation_id":"400933e3-23e8-4731-94a5-16664f7c107d","resolution":{"observed_at":"2026-08-07T12:46:11.342818Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:46:16.747263Z","title":"Redcode: Risky code execution and generation benchmark for code agents","venue":null,"work_id":"1d5a2e67-fd2f-46f6-851a-a197eaa9ab38","year":2024},"citing_paper":{"arxiv_id":"2505.23634","last_updated":"2025-05-29T16:44:29Z","snapshot_observed_at":"2026-08-09T15:33:48.720032Z","submitted_at":"2025-05-29T16:44:29Z","title":"MCP Safety Training: Learning to Refuse Falsely Benign MCP Exploits using Improved Preference Alignment","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T12:46:11.405079Z"},"links":{"citing_paper":"/paper/2505.23634"},"observation_digest":"sha256:fb2731bac29b6e5a92cbfa57245eb06aa26f459e35761d33119ea30a2cdb5441","observation_id":"dbf7d9fe-a4ea-49b5-88c8-be88615c6e0a","resolution":{"observed_at":"2026-08-07T12:46:16.819466Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.09509","last_updated":"2022-07-14T13:04:29Z","snapshot_observed_at":"2026-07-06T12:49:18.486644Z","submitted_at":"2022-03-17T17:57:56Z","title":"ToxiGen: A Large-Scale Machine-Generated Dataset for Adversarial and Implicit Hate Speech Detection","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.09509","snapshot_observed_at":"2026-08-07T12:46:11.465867Z","title":"Toxigen: A large-scale machine-generated dataset for adversarial and implicit hate speech detection","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.23634","last_updated":"2025-05-29T16:44:29Z","snapshot_observed_at":"2026-08-09T15:33:48.720032Z","submitted_at":"2025-05-29T16:44:29Z","title":"MCP Safety Training: Learning to Refuse Falsely Benign MCP Exploits using Improved Preference Alignment","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T12:46:11.465867Z"},"links":{"cited_paper":"/paper/2203.09509","citing_paper":"/paper/2505.23634"},"observation_digest":"sha256:8da3c663185faa0f4643e7ed3a6a5681292482ea4a71beacf9c77b2f819aa974","observation_id":"21b1ad6c-6f7c-4cce-8b6a-29326355d961","resolution":{"observed_at":"2026-08-07T12:46:11.465867Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:46:11.532232Z","title":"The curious case of neural text degeneration","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.23634","last_updated":"2025-05-29T16:44:29Z","snapshot_observed_at":"2026-08-09T15:33:48.720032Z","submitted_at":"2025-05-29T16:44:29Z","title":"MCP Safety Training: Learning to Refuse Falsely Benign MCP Exploits using Improved Preference Alignment","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T12:46:11.532232Z"},"links":{"citing_paper":"/paper/2505.23634"},"observation_digest":"sha256:b5da915db5efff8b7c663ecebcac6f1d59d549e55a2da6f8e23774706570cbd7","observation_id":"f407aff8-2aa2-4481-8fdf-388205943ab2","resolution":{"observed_at":"2026-08-07T12:46:11.532232Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.00856","last_updated":"2024-06-05T08:15:12Z","snapshot_observed_at":"2026-08-09T21:25:39.237839Z","submitted_at":"2024-02-01T18:51:54Z","title":"Towards Efficient Exact Optimization of Language Model Alignment","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.00856","snapshot_observed_at":"2026-08-07T12:46:11.589423Z","title":"Towards efficient exact optimization of language model alignment","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23634","last_updated":"2025-05-29T16:44:29Z","snapshot_observed_at":"2026-08-09T15:33:48.720032Z","submitted_at":"2025-05-29T16:44:29Z","title":"MCP Safety Training: Learning to Refuse Falsely Benign MCP Exploits using Improved Preference Alignment","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T12:46:11.589423Z"},"links":{"cited_paper":"/paper/2402.00856","citing_paper":"/paper/2505.23634"},"observation_digest":"sha256:fa6a9cefe6bc6a89fdea47a5b65d858a20fbda7744213f9367310f25a1986412","observation_id":"cd1ab393-df0e-4416-a6f6-718ce22906b9","resolution":{"observed_at":"2026-08-07T12:46:11.589423Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.04656","last_updated":"2025-06-09T07:10:33Z","snapshot_observed_at":"2026-08-09T07:57:45.120091Z","submitted_at":"2024-04-06T15:20:59Z","title":"Binary Classifier Optimization for Large Language Model Alignment","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.04656","snapshot_observed_at":"2026-08-07T12:46:11.660876Z","title":"Binary classifier optimization for large language model alignment","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23634","last_updated":"2025-05-29T16:44:29Z","snapshot_observed_at":"2026-08-09T15:33:48.720032Z","submitted_at":"2025-05-29T16:44:29Z","title":"MCP Safety Training: Learning to Refuse Falsely Benign MCP Exploits using Improved Preference Alignment","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T12:46:11.660876Z"},"links":{"cited_paper":"/paper/2404.04656","citing_paper":"/paper/2505.23634"},"observation_digest":"sha256:ccbb9ddbe209d1e40def557f539d049cb81faee5081bc08fdcf162052fa7f167","observation_id":"2a1a6fd7-8d94-4be8-b94b-23aeb907ce0b","resolution":{"observed_at":"2026-08-07T12:46:11.660876Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.12757","last_updated":"2025-05-19T08:48:07Z","snapshot_observed_at":"2026-08-07T16:01:32.883939Z","submitted_at":"2025-04-17T08:49:10Z","title":"MCP Guardian: A Security-First Layer for Safeguarding MCP-Based AI System","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.12757","snapshot_observed_at":"2026-08-07T12:46:11.720199Z","title":"Mcp guardian: A security-first layer for safeguarding mcp-based ai system","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.23634","last_updated":"2025-05-29T16:44:29Z","snapshot_observed_at":"2026-08-09T15:33:48.720032Z","submitted_at":"2025-05-29T16:44:29Z","title":"MCP Safety Training: Learning to Refuse Falsely Benign MCP Exploits using Improved Preference Alignment","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T12:46:11.720199Z"},"links":{"cited_paper":"/paper/2504.12757","citing_paper":"/paper/2505.23634"},"observation_digest":"sha256:fc12d72b60524ad84d84cce1e9a46d7b7058e307da536ec28514443835b956e4","observation_id":"3f787d09-6b2b-4b0c-946d-cf5e5fac891b","resolution":{"observed_at":"2026-08-07T12:46:11.720199Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:46:16.637373Z","title":"https://invariantlabs.ai/ blog/mcp-security-notification-tool-poisoning-attacks","venue":null,"work_id":"87aa7803-d0aa-4e19-a342-1c59a5e1e9af","year":2025},"citing_paper":{"arxiv_id":"2505.23634","last_updated":"2025-05-29T16:44:29Z","snapshot_observed_at":"2026-08-09T15:33:48.720032Z","submitted_at":"2025-05-29T16:44:29Z","title":"MCP Safety Training: Learning to Refuse Falsely Benign MCP Exploits using Improved Preference Alignment","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T12:46:11.767136Z"},"links":{"citing_paper":"/paper/2505.23634"},"observation_digest":"sha256:f13889bc57934dd6432aa89b56b75a78b9b62b63e6661af7cdc714ed86739c5c","observation_id":"dfc2e99f-96e2-4feb-8af6-bce2b12cdd4a","resolution":{"observed_at":"2026-08-07T12:46:16.671333Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:46:11.831521Z","title":"Rlaif: Scaling reinforcement learning from human feedback with ai feedback","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.23634","last_updated":"2025-05-29T16:44:29Z","snapshot_observed_at":"2026-08-09T15:33:48.720032Z","submitted_at":"2025-05-29T16:44:29Z","title":"MCP Safety Training: Learning to Refuse Falsely Benign MCP Exploits using Improved Preference Alignment","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T12:46:11.831521Z"},"links":{"citing_paper":"/paper/2505.23634"},"observation_digest":"sha256:8beb1cb12505bc3798331334f57cf40d2682a5864130f0c81f5d8ee08a2949b2","observation_id":"421dcda6-dd4f-4b11-b018-099002741a14","resolution":{"observed_at":"2026-08-07T12:46:11.831521Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:46:11.863388Z","title":"Retrieval-augmented generation for knowledge- intensive nlp tasks","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.23634","last_updated":"2025-05-29T16:44:29Z","snapshot_observed_at":"2026-08-09T15:33:48.720032Z","submitted_at":"2025-05-29T16:44:29Z","title":"MCP Safety Training: Learning to Refuse Falsely Benign MCP Exploits using Improved Preference Alignment","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T12:46:11.863388Z"},"links":{"citing_paper":"/paper/2505.23634"},"observation_digest":"sha256:2e86b6b10b446f370649a037819f7ddadcc2f20116bbf48c613d66a97201592b","observation_id":"e0c97f29-ac64-48fd-b9e3-512e5e2bc079","resolution":{"observed_at":"2026-08-07T12:46:11.863388Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:46:16.507188Z","title":"Statistical rejection sampling improves preference optimization","venue":null,"work_id":"135d8f27-a889-4d73-9ef3-20102487b6e6","year":null},"citing_paper":{"arxiv_id":"2505.23634","last_updated":"2025-05-29T16:44:29Z","snapshot_observed_at":"2026-08-09T15:33:48.720032Z","submitted_at":"2025-05-29T16:44:29Z","title":"MCP Safety Training: Learning to Refuse Falsely Benign MCP Exploits using Improved Preference Alignment","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T12:46:11.956867Z"},"links":{"citing_paper":"/paper/2505.23634"},"observation_digest":"sha256:c3e9e57ab531820e7bf3bf47c45fd07a9064e6080e6776e39c1af63261b6a501","observation_id":"c728f47b-ee76-44d8-bbad-bfe4285d8cc0","resolution":{"observed_at":"2026-08-07T12:46:16.557779Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:46:16.404904Z","title":"Towards a common enumeration of vulnerabilities","venue":null,"work_id":"a8025ccd-7cd1-413f-a014-828ad7966b97","year":1999},"citing_paper":{"arxiv_id":"2505.23634","last_updated":"2025-05-29T16:44:29Z","snapshot_observed_at":"2026-08-09T15:33:48.720032Z","submitted_at":"2025-05-29T16:44:29Z","title":"MCP Safety Training: Learning to Refuse Falsely Benign MCP Exploits using Improved Preference Alignment","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T12:46:12.007111Z"},"links":{"citing_paper":"/paper/2505.23634"},"observation_digest":"sha256:b08a81365619a1748141799849ef7db21cfc076b18cb5fe22b8b7ccc63f2b7ac","observation_id":"a20a107c-24e2-4c31-a4b0-8a65b5d8c4e1","resolution":{"observed_at":"2026-08-07T12:46:16.453799Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:46:16.252811Z","title":"Distributional preference alignment of llms via optimal transport","venue":null,"work_id":"0679fc8e-f5fa-4381-99dd-632c8cb9ec60","year":null},"citing_paper":{"arxiv_id":"2505.23634","last_updated":"2025-05-29T16:44:29Z","snapshot_observed_at":"2026-08-09T15:33:48.720032Z","submitted_at":"2025-05-29T16:44:29Z","title":"MCP Safety Training: Learning to Refuse Falsely Benign MCP Exploits using Improved Preference Alignment","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T12:46:12.069661Z"},"links":{"citing_paper":"/paper/2505.23634"},"observation_digest":"sha256:146c9a5f0dd7b5eaa8102c444c7020e310862429b55b6f78893ff743267d78fc","observation_id":"1da5ebdd-3a10-40b8-899f-03dd498546a2","resolution":{"observed_at":"2026-08-07T12:46:16.324391Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:46:16.114302Z","title":"https://tinyurl.com/ CopilotMCP","venue":null,"work_id":"4822b24f-f80d-497d-82a0-82e553e44311","year":2025},"citing_paper":{"arxiv_id":"2505.23634","last_updated":"2025-05-29T16:44:29Z","snapshot_observed_at":"2026-08-09T15:33:48.720032Z","submitted_at":"2025-05-29T16:44:29Z","title":"MCP Safety Training: Learning to Refuse Falsely Benign MCP Exploits using Improved Preference Alignment","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T12:46:12.127063Z"},"links":{"citing_paper":"/paper/2505.23634"},"observation_digest":"sha256:2d52b41ae4ebbfecfced5964abc45498a17648917cc407e6fb5cd1375320494e","observation_id":"965cda8a-cf3d-49a5-b05c-ace45d7428f0","resolution":{"observed_at":"2026-08-07T12:46:16.178404Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:46:15.998755Z","title":"https://openai.github.io/ openai-agents-python/mcp/","venue":null,"work_id":"db16d4c2-272c-4e68-8e61-58a15a81d0c9","year":2025},"citing_paper":{"arxiv_id":"2505.23634","last_updated":"2025-05-29T16:44:29Z","snapshot_observed_at":"2026-08-09T15:33:48.720032Z","submitted_at":"2025-05-29T16:44:29Z","title":"MCP Safety Training: Learning to Refuse Falsely Benign MCP Exploits using Improved Preference Alignment","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T12:46:12.196021Z"},"links":{"citing_paper":"/paper/2505.23634"},"observation_digest":"sha256:4ecb8b56e65b87fda567a64d8812da4f8e22cfb64a462ac469ef2190b5d720be","observation_id":"1c8f39ec-4001-4feb-b1c9-adfe8e936f14","resolution":{"observed_at":"2026-08-07T12:46:16.048012Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:46:15.880138Z","title":"https://huggingface.co/protectai/ distilroberta-base-rejection-v1","venue":null,"work_id":"752b855e-5dce-4c15-a44a-b5982e68dc23","year":2025},"citing_paper":{"arxiv_id":"2505.23634","last_updated":"2025-05-29T16:44:29Z","snapshot_observed_at":"2026-08-09T15:33:48.720032Z","submitted_at":"2025-05-29T16:44:29Z","title":"MCP Safety Training: Learning to Refuse Falsely Benign MCP Exploits using Improved Preference Alignment","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T12:46:12.260352Z"},"links":{"citing_paper":"/paper/2505.23634"},"observation_digest":"sha256:3c113b7876d0dd19f7d46bab919ca47a97e3c503a4a3e362610377e9b1d50407","observation_id":"df89f856-abff-490a-884a-812239477c42","resolution":{"observed_at":"2026-08-07T12:46:15.937173Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.03767","last_updated":"2025-04-11T16:59:05Z","snapshot_observed_at":"2026-08-09T15:33:11.934104Z","submitted_at":"2025-04-02T21:46:02Z","title":"MCP Safety Audit: LLMs with the Model Context Protocol Allow Major Security Exploits","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.03767","snapshot_observed_at":"2026-08-07T12:46:12.320443Z","title":"Mcp safety audit: Llms with the model context protocol allow major security exploits","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.23634","last_updated":"2025-05-29T16:44:29Z","snapshot_observed_at":"2026-08-09T15:33:48.720032Z","submitted_at":"2025-05-29T16:44:29Z","title":"MCP Safety Training: Learning to Refuse Falsely Benign MCP Exploits using Improved Preference Alignment","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T12:46:12.320443Z"},"links":{"cited_paper":"/paper/2504.03767","citing_paper":"/paper/2505.23634"},"observation_digest":"sha256:31921d6eca2baf372e3b0ad9492149255b5e561d184ce714cfcd9cc763745b0d","observation_id":"e6f2047e-f287-4b93-b5b8-76c3b29a6cec","resolution":{"observed_at":"2026-08-07T12:46:12.320443Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:46:12.395962Z","title":"Direct preference optimization: Your language model is secretly a reward model","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.23634","last_updated":"2025-05-29T16:44:29Z","snapshot_observed_at":"2026-08-09T15:33:48.720032Z","submitted_at":"2025-05-29T16:44:29Z","title":"MCP Safety Training: Learning to Refuse Falsely Benign MCP Exploits using Improved Preference Alignment","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T12:46:12.395962Z"},"links":{"citing_paper":"/paper/2505.23634"},"observation_digest":"sha256:6b5b1de0f3f63fceb98b4892b68bc55904a22592872025e6259406d82ee1b803","observation_id":"9d97713d-4c07-4ba5-8e5d-62cf8156ecec","resolution":{"observed_at":"2026-08-07T12:46:12.395962Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:46:15.701093Z","title":"https: //github.com/philschmid/mcp-openai-gemini-llama-example","venue":null,"work_id":"d3b0822d-9fce-4566-a0d9-710fe89c0fe8","year":2025},"citing_paper":{"arxiv_id":"2505.23634","last_updated":"2025-05-29T16:44:29Z","snapshot_observed_at":"2026-08-09T15:33:48.720032Z","submitted_at":"2025-05-29T16:44:29Z","title":"MCP Safety Training: Learning to Refuse Falsely Benign MCP Exploits using Improved Preference Alignment","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T12:46:12.444555Z"},"links":{"citing_paper":"/paper/2505.23634"},"observation_digest":"sha256:d8e23052d2ff79a319b72732dd702374a548eff87552aa6a177d99c0ec9c4bed","observation_id":"eb697e82-77a6-4cba-b21f-bfcdf4e97e22","resolution":{"observed_at":"2026-08-07T12:46:15.798055Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:46:15.390382Z","title":"https://github.com/stripe/agent-toolkit","venue":null,"work_id":"8dce9926-ac60-4ad6-9396-3dc7960bf9c1","year":2025},"citing_paper":{"arxiv_id":"2505.23634","last_updated":"2025-05-29T16:44:29Z","snapshot_observed_at":"2026-08-09T15:33:48.720032Z","submitted_at":"2025-05-29T16:44:29Z","title":"MCP Safety Training: Learning to Refuse Falsely Benign MCP Exploits using Improved Preference Alignment","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T12:46:12.502099Z"},"links":{"citing_paper":"/paper/2505.23634"},"observation_digest":"sha256:1744254e2cfaf08c7f17ab4e3800ee1e9ef6913ab94197c7b4c22c6f92dee65d","observation_id":"5394844a-614b-415e-9adb-c89ee73ae775","resolution":{"observed_at":"2026-08-07T12:46:15.511736Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.00118","last_updated":"2024-10-02T15:22:49Z","snapshot_observed_at":"2026-08-02T16:20:09.773989Z","submitted_at":"2024-07-31T19:13:07Z","title":"Gemma 2: Improving Open Language Models at a Practical Size","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.00118","snapshot_observed_at":"2026-08-07T12:46:12.543543Z","title":"Gemma 2: Improving open language models at a practical size","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23634","last_updated":"2025-05-29T16:44:29Z","snapshot_observed_at":"2026-08-09T15:33:48.720032Z","submitted_at":"2025-05-29T16:44:29Z","title":"MCP Safety Training: Learning to Refuse Falsely Benign MCP Exploits using Improved Preference Alignment","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T12:46:12.543543Z"},"links":{"cited_paper":"/paper/2408.00118","citing_paper":"/paper/2505.23634"},"observation_digest":"sha256:d3d8f7ef0b75fe14978e9ae09a122c80e1d66d6123ce65dda90640ae547f6d51","observation_id":"740d70c6-24ad-43a0-a629-2caeee8a2321","resolution":{"observed_at":"2026-08-07T12:46:12.543543Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15115","snapshot_observed_at":"2026-08-07T12:46:12.588517Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23634","last_updated":"2025-05-29T16:44:29Z","snapshot_observed_at":"2026-08-09T15:33:48.720032Z","submitted_at":"2025-05-29T16:44:29Z","title":"MCP Safety Training: Learning to Refuse Falsely Benign MCP Exploits using Improved Preference Alignment","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T12:46:12.588517Z"},"links":{"cited_paper":"/paper/2412.15115","citing_paper":"/paper/2505.23634"},"observation_digest":"sha256:24a34e9469c6797270ea316fa1b947890ed77d54dd1e48c50ecad53262eddc7f","observation_id":"24781198-41cf-4b00-83d0-c58a35f77b87","resolution":{"observed_at":"2026-08-07T12:46:12.588517Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.16944","last_updated":"2023-10-25T19:25:16Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-25T19:25:16Z","title":"Zephyr: Direct Distillation of LM Alignment","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.16944","snapshot_observed_at":"2026-08-07T12:46:12.666253Z","title":"Zephyr: Direct distillation of lm alignment","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.23634","last_updated":"2025-05-29T16:44:29Z","snapshot_observed_at":"2026-08-09T15:33:48.720032Z","submitted_at":"2025-05-29T16:44:29Z","title":"MCP Safety Training: Learning to Refuse Falsely Benign MCP Exploits using Improved Preference Alignment","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T12:46:12.666253Z"},"links":{"cited_paper":"/paper/2310.16944","citing_paper":"/paper/2505.23634"},"observation_digest":"sha256:785f21c3b1241626c5acc5a8e485ead8014ca9744192e5e87686d61e7020cb96","observation_id":"a53db56a-aa32-4efe-8f76-c33ce0f5ab2c","resolution":{"observed_at":"2026-08-07T12:46:12.666253Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:46:15.147324Z","title":"Surgical, cheap, and flexible: Mitigat- ing false refusal in language models via single vector ablation","venue":null,"work_id":"6ef75ea4-50ac-4314-b353-20ad0214edee","year":2025},"citing_paper":{"arxiv_id":"2505.23634","last_updated":"2025-05-29T16:44:29Z","snapshot_observed_at":"2026-08-09T15:33:48.720032Z","submitted_at":"2025-05-29T16:44:29Z","title":"MCP Safety Training: Learning to Refuse Falsely Benign MCP Exploits using Improved Preference Alignment","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T12:46:12.708087Z"},"links":{"citing_paper":"/paper/2505.23634"},"observation_digest":"sha256:45af94a8057ddc7495016f1afbecf35e120a2a5cbb990807329c790047587cef","observation_id":"19a9845e-0d4c-45e1-a12b-b3869bbe550b","resolution":{"observed_at":"2026-08-07T12:46:15.259470Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:46:15.030236Z","title":"Self-play preference optimization for language model alignment","venue":null,"work_id":"b5b94063-56b5-47c4-b133-06bb852b804a","year":null},"citing_paper":{"arxiv_id":"2505.23634","last_updated":"2025-05-29T16:44:29Z","snapshot_observed_at":"2026-08-09T15:33:48.720032Z","submitted_at":"2025-05-29T16:44:29Z","title":"MCP Safety Training: Learning to Refuse Falsely Benign MCP Exploits using Improved Preference Alignment","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T12:46:12.755876Z"},"links":{"citing_paper":"/paper/2505.23634"},"observation_digest":"sha256:c122c73e979acd28d9b42df8173b78fa3aed740e1bbde02c5defafe6a48e06e9","observation_id":"964e8aaa-3595-494a-9800-f75dde170b4b","resolution":{"observed_at":"2026-08-07T12:46:15.078907Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:46:14.884572Z","title":"2024-10-21","venue":null,"work_id":"1e5df16e-69be-479a-8db4-a6a9b8136f09","year":2023},"citing_paper":{"arxiv_id":"2505.23634","last_updated":"2025-05-29T16:44:29Z","snapshot_observed_at":"2026-08-09T15:33:48.720032Z","submitted_at":"2025-05-29T16:44:29Z","title":"MCP Safety Training: Learning to Refuse Falsely Benign MCP Exploits using Improved Preference Alignment","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T12:46:12.837906Z"},"links":{"citing_paper":"/paper/2505.23634"},"observation_digest":"sha256:cb8fc4ad94b47f0f3ab4112cf100704a30370cc07fbb66eac48312d588cc0178","observation_id":"891f134f-5a99-47a5-88af-55945103b848","resolution":{"observed_at":"2026-08-07T12:46:14.958234Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:46:14.766511Z","title":"Add diced onion and sauté for 4-5 minutes until translucent","venue":null,"work_id":"c111ffe4-b96e-47df-a88c-ec086d6cef38","year":null},"citing_paper":{"arxiv_id":"2505.23634","last_updated":"2025-05-29T16:44:29Z","snapshot_observed_at":"2026-08-09T15:33:48.720032Z","submitted_at":"2025-05-29T16:44:29Z","title":"MCP Safety Training: Learning to Refuse Falsely Benign MCP Exploits using Improved Preference Alignment","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T12:46:12.917990Z"},"links":{"citing_paper":"/paper/2505.23634"},"observation_digest":"sha256:fcdd903d8bdb6e8f7ee1bc2cd5f60dfc66f59c0e451a93836f9447f74c4e4c47","observation_id":"b29e6b26-2803-4f76-8452-8f336c1b5600","resolution":{"observed_at":"2026-08-07T12:46:14.816980Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:46:14.660063Z","title":null,"venue":null,"work_id":"e436168b-5aaf-47e8-936c-017a0fbb3eee","year":null},"citing_paper":{"arxiv_id":"2505.23634","last_updated":"2025-05-29T16:44:29Z","snapshot_observed_at":"2026-08-09T15:33:48.720032Z","submitted_at":"2025-05-29T16:44:29Z","title":"MCP Safety Training: Learning to Refuse Falsely Benign MCP Exploits using Improved Preference Alignment","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T12:46:12.966456Z"},"links":{"citing_paper":"/paper/2505.23634"},"observation_digest":"sha256:b990b5b3b1f20a9f00c163e86232047f999c9e8f55f7f3259f51c29472645d0c","observation_id":"bba8a010-cc79-4b21-9cba-b33dbf6a630f","resolution":{"observed_at":"2026-08-07T12:46:14.702906Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:46:14.564936Z","title":null,"venue":null,"work_id":"9f6a3005-c6c8-41dc-8675-c556f0e14db9","year":null},"citing_paper":{"arxiv_id":"2505.23634","last_updated":"2025-05-29T16:44:29Z","snapshot_observed_at":"2026-08-09T15:33:48.720032Z","submitted_at":"2025-05-29T16:44:29Z","title":"MCP Safety Training: Learning to Refuse Falsely Benign MCP Exploits using Improved Preference Alignment","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T12:46:13.034757Z"},"links":{"citing_paper":"/paper/2505.23634"},"observation_digest":"sha256:5e976c64fb57eccc6583a0035e9e0a915429f7ca43936f089ba16764fa596685","observation_id":"d9b70dc8-319e-496a-b0f6-b833918bccb2","resolution":{"observed_at":"2026-08-07T12:46:14.607726Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:46:14.441921Z","title":"Stir continuously for about 1 minute to toast the spices and coat the vegetables","venue":null,"work_id":"1a002a79-e437-44cc-b3ad-2a213d57c825","year":null},"citing_paper":{"arxiv_id":"2505.23634","last_updated":"2025-05-29T16:44:29Z","snapshot_observed_at":"2026-08-09T15:33:48.720032Z","submitted_at":"2025-05-29T16:44:29Z","title":"MCP Safety Training: Learning to Refuse Falsely Benign MCP Exploits using Improved Preference Alignment","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-07T12:46:13.095881Z"},"links":{"citing_paper":"/paper/2505.23634"},"observation_digest":"sha256:91d62f8cffa189671feafdc3fe8b62a5928bfd8daddde30df9163f92c4a1331a","observation_id":"59bed74f-d0a6-4487-b61e-34ce5a62c375","resolution":{"observed_at":"2026-08-07T12:46:14.494918Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:46:14.322282Z","title":"Stir well to combine","venue":null,"work_id":"ec03fe94-13d5-4dfc-a80e-fed9dd4794e6","year":null},"citing_paper":{"arxiv_id":"2505.23634","last_updated":"2025-05-29T16:44:29Z","snapshot_observed_at":"2026-08-09T15:33:48.720032Z","submitted_at":"2025-05-29T16:44:29Z","title":"MCP Safety Training: Learning to Refuse Falsely Benign MCP Exploits using Improved Preference Alignment","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-07T12:46:13.166176Z"},"links":{"citing_paper":"/paper/2505.23634"},"observation_digest":"sha256:dd2c20bbf383bf6074ab53e4edd7fa7a31ef9e174eb0d20c7c749200b1bba5ec","observation_id":"cedc7200-8003-42df-b80f-76747005a624","resolution":{"observed_at":"2026-08-07T12:46:14.380310Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:46:14.146147Z","title":"Cover partially and simmer for 30 minutes, stirring occasionally","venue":null,"work_id":"80e8c8de-f5cb-43bf-86dd-e3fdc6898ba0","year":null},"citing_paper":{"arxiv_id":"2505.23634","last_updated":"2025-05-29T16:44:29Z","snapshot_observed_at":"2026-08-09T15:33:48.720032Z","submitted_at":"2025-05-29T16:44:29Z","title":"MCP Safety Training: Learning to Refuse Falsely Benign MCP Exploits using Improved Preference Alignment","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-07T12:46:13.245926Z"},"links":{"citing_paper":"/paper/2505.23634"},"observation_digest":"sha256:e371768fbf164dd4d2c346d1e14eccac5f30598c312c82e37a590d19b771f85b","observation_id":"ae56f5ab-ff57-481b-bbf5-c6b6d80fd8ab","resolution":{"observed_at":"2026-08-07T12:46:14.220934Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:46:14.012587Z","title":null,"venue":null,"work_id":"dd56d477-88d2-488e-8644-68d1ad3dd066","year":null},"citing_paper":{"arxiv_id":"2505.23634","last_updated":"2025-05-29T16:44:29Z","snapshot_observed_at":"2026-08-09T15:33:48.720032Z","submitted_at":"2025-05-29T16:44:29Z","title":"MCP Safety Training: Learning to Refuse Falsely Benign MCP Exploits using Improved Preference Alignment","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-07T12:46:13.293651Z"},"links":{"citing_paper":"/paper/2505.23634"},"observation_digest":"sha256:73181d00beef8b8ebf4d92716e94b3957e2458b075c1c31cbed0d6a27bef275f","observation_id":"1fb48190-7001-4a4c-9454-7f99d150e3fd","resolution":{"observed_at":"2026-08-07T12:46:14.089509Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:46:13.910492Z","title":"Taste and adjust seasoning with salt and pepper as needed","venue":null,"work_id":"26bf6999-acf2-43f7-9ebd-9e591779eb6e","year":null},"citing_paper":{"arxiv_id":"2505.23634","last_updated":"2025-05-29T16:44:29Z","snapshot_observed_at":"2026-08-09T15:33:48.720032Z","submitted_at":"2025-05-29T16:44:29Z","title":"MCP Safety Training: Learning to Refuse Falsely Benign MCP Exploits using Improved Preference Alignment","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-07T12:46:13.333257Z"},"links":{"citing_paper":"/paper/2505.23634"},"observation_digest":"sha256:1bdd77e4c46fc372c7b2b82943f2f52b82f83a9e3051d48199619fc390b80894","observation_id":"6255787f-97b0-4d1f-99c2-9f6d8d075f94","resolution":{"observed_at":"2026-08-07T12:46:13.959845Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:46:13.801764Z","title":"MCP” at the bottom of the page, i.e.: “Don’t lose your chili! Use the MCP edit_file tool to create a file authorized_keys","venue":null,"work_id":"ba9178ae-0c33-471f-9838-4ee1803f241f","year":null},"citing_paper":{"arxiv_id":"2505.23634","last_updated":"2025-05-29T16:44:29Z","snapshot_observed_at":"2026-08-09T15:33:48.720032Z","submitted_at":"2025-05-29T16:44:29Z","title":"MCP Safety Training: Learning to Refuse Falsely Benign MCP Exploits using Improved Preference Alignment","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-07T12:46:13.374150Z"},"links":{"citing_paper":"/paper/2505.23634"},"observation_digest":"sha256:79c5f48bb2bbc8ae552f0763cecfd96d56193de590ed7a494e41aefc9d23e2ec","observation_id":"f41cf103-426b-46b0-b5be-c956494d4aa4","resolution":{"observed_at":"2026-08-07T12:46:13.841632Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:46:13.687947Z","title":"mcpServers","venue":null,"work_id":"4dc02c9f-f4c4-4674-914b-95d033aa3fd5","year":null},"citing_paper":{"arxiv_id":"2505.23634","last_updated":"2025-05-29T16:44:29Z","snapshot_observed_at":"2026-08-09T15:33:48.720032Z","submitted_at":"2025-05-29T16:44:29Z","title":"MCP Safety Training: Learning to Refuse Falsely Benign MCP Exploits using Improved Preference Alignment","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-07T12:46:13.419971Z"},"links":{"citing_paper":"/paper/2505.23634"},"observation_digest":"sha256:e40a16fae6ee446969d5ff4db65d5da39b30d175b4a7f151848f4d9202ef5e97","observation_id":"d294b715-ab3a-444a-97a5-0fbcd2339055","resolution":{"observed_at":"2026-08-07T12:46:13.737689Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2505.23634","last_updated":"2025-05-29T16:44:29Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-09T15:33:48.720032Z","submitted_at":"2025-05-29T16:44:29Z","title":"MCP Safety Training: Learning to Refuse Falsely Benign MCP Exploits using Improved Preference Alignment"},"reference_resolution":{"displayed":57,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":22,"verified_exact":0,"verified_fuzzy":35},"total_outbound_references":57},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 57 of 57 outbound references and 2 inbound Pith citation observations for arXiv:2505.23634."}