{"as_of":"2026-08-10T07:35:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:f43e74c545f392be947c7fc4a26a24eeb30b523ccbd8bf6ad3eaae4caa3688c5","coverage":[{"denominator":67,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":67,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-08T19:58:17.376083Z","state":"measured"},{"denominator":67,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":67,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2608.04317/citation-record","integrity":"/paper/2608.04317/integrity","json":"/paper/2608.04317/citation-record.json","paper":"/paper/2608.04317"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T19:58:18.294729Z","title":"https://www.atomicredteam.io/","venue":null,"work_id":"38195466-b005-461a-aa77-a0f1b6adb4c1","year":2026},"citing_paper":{"arxiv_id":"2608.04317","last_updated":"2026-08-05T00:54:57Z","snapshot_observed_at":"2026-08-09T19:45:40.565565Z","submitted_at":"2026-08-05T00:54:57Z","title":"Trident : How to Break Deep Reinforcement Learning Cyber Defenses (Agentic)","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-08T19:58:17.162099Z"},"links":{"citing_paper":"/paper/2608.04317"},"observation_digest":"sha256:66dd881d1c4a20f5a353820cd0784d38edaf11abbea55f8100d925f69f4c949d","observation_id":"e9e9ffb8-750e-4b83-8c2f-bd45f20644c3","resolution":{"observed_at":"2026-08-08T19:58:18.297825Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T19:58:18.285332Z","title":"https://aicyberchallenge.com/ overview/","venue":null,"work_id":"250ad4f6-871a-4986-a8a2-3c1c700dd6d7","year":2026},"citing_paper":{"arxiv_id":"2608.04317","last_updated":"2026-08-05T00:54:57Z","snapshot_observed_at":"2026-08-09T19:45:40.565565Z","submitted_at":"2026-08-05T00:54:57Z","title":"Trident : How to Break Deep Reinforcement Learning Cyber Defenses (Agentic)","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-08T19:58:17.166233Z"},"links":{"citing_paper":"/paper/2608.04317"},"observation_digest":"sha256:11a7213a5f846a9c78b18678c34af0752fcd81db5f23861087af9243694a3199","observation_id":"55d89643-12c0-4fe2-b587-e12a11e90d67","resolution":{"observed_at":"2026-08-08T19:58:18.288443Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T19:58:18.275844Z","title":"https://attack.mitre.org/","venue":null,"work_id":"3b52ad85-58c1-46dc-be4b-675234471641","year":2026},"citing_paper":{"arxiv_id":"2608.04317","last_updated":"2026-08-05T00:54:57Z","snapshot_observed_at":"2026-08-09T19:45:40.565565Z","submitted_at":"2026-08-05T00:54:57Z","title":"Trident : How to Break Deep Reinforcement Learning Cyber Defenses (Agentic)","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-08T19:58:17.169561Z"},"links":{"citing_paper":"/paper/2608.04317"},"observation_digest":"sha256:a373a26f3dd6bbf0ece335215a8f7677c3b6496ca516018266f164a1f5ae6681","observation_id":"01e142a8-f26c-45f9-9bbe-4eb79a5a53e1","resolution":{"observed_at":"2026-08-08T19:58:18.279178Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T19:58:18.266657Z","title":"EnIGMA: Interactive tools substantially assist LM agents in finding security vulnerabilities","venue":null,"work_id":"a1630aa5-5d4e-494c-a3fb-6a7a3eaee805","year":2025},"citing_paper":{"arxiv_id":"2608.04317","last_updated":"2026-08-05T00:54:57Z","snapshot_observed_at":"2026-08-09T19:45:40.565565Z","submitted_at":"2026-08-05T00:54:57Z","title":"Trident : How to Break Deep Reinforcement Learning Cyber Defenses (Agentic)","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-08T19:58:17.173238Z"},"links":{"citing_paper":"/paper/2608.04317"},"observation_digest":"sha256:10c4aac0f3e20db5baa71349d0dd16ba325984e5a6cb12f73ceb27226a3296dc","observation_id":"79f9f41b-f184-4565-abc2-5c6a8e94bdcd","resolution":{"observed_at":"2026-08-08T19:58:18.270066Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T19:58:17.176790Z","title":"Back to basics: Revisiting REINFORCE-style optimization for learning from human feedback in LLMs","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.04317","last_updated":"2026-08-05T00:54:57Z","snapshot_observed_at":"2026-08-09T19:45:40.565565Z","submitted_at":"2026-08-05T00:54:57Z","title":"Trident : How to Break Deep Reinforcement Learning Cyber Defenses (Agentic)","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-08T19:58:17.176790Z"},"links":{"citing_paper":"/paper/2608.04317"},"observation_digest":"sha256:9c13d62f0dd9227118aaff0b2851102ee9844fa61e079a9733b8e24ad47c6db6","observation_id":"067df76b-02b2-4127-a1bc-ba247e54a6f4","resolution":{"observed_at":"2026-08-08T19:58:17.176790Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T19:58:18.251999Z","title":"Ctibench: a benchmark for evaluating llms in cyber threat intelligence","venue":null,"work_id":"bf9c441b-f6f8-4d31-b8ea-9099bd5872c1","year":2024},"citing_paper":{"arxiv_id":"2608.04317","last_updated":"2026-08-05T00:54:57Z","snapshot_observed_at":"2026-08-09T19:45:40.565565Z","submitted_at":"2026-08-05T00:54:57Z","title":"Trident : How to Break Deep Reinforcement Learning Cyber Defenses (Agentic)","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-08T19:58:17.180734Z"},"links":{"citing_paper":"/paper/2608.04317"},"observation_digest":"sha256:efbe8e2d153eb07ce430022e92d3d1b1a74b6d14091722afe1b0ed26963b7e97","observation_id":"141545ae-3ce0-4a1b-9c95-bb69a16af683","resolution":{"observed_at":"2026-08-08T19:58:18.255302Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T19:58:18.242715Z","title":"Claude Mythos Preview red.anthropic.com — red.anthropic.com","venue":null,"work_id":"174c4cd3-5fe7-4d29-ba65-1d473ff6fdec","year":2026},"citing_paper":{"arxiv_id":"2608.04317","last_updated":"2026-08-05T00:54:57Z","snapshot_observed_at":"2026-08-09T19:45:40.565565Z","submitted_at":"2026-08-05T00:54:57Z","title":"Trident : How to Break Deep Reinforcement Learning Cyber Defenses (Agentic)","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-08T19:58:17.185307Z"},"links":{"citing_paper":"/paper/2608.04317"},"observation_digest":"sha256:22a81cd2139869041700acad69a058b5072b94a5002983946fdd94065cddbfa8","observation_id":"489af948-f565-4c76-9a3a-e2ed8ea9bf0b","resolution":{"observed_at":"2026-08-08T19:58:18.245978Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.13161","last_updated":"2024-04-19T20:11:12Z","snapshot_observed_at":"2026-08-07T13:01:36.699787Z","submitted_at":"2024-04-19T20:11:12Z","title":"CyberSecEval 2: A Wide-Ranging Cybersecurity Evaluation Suite for Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.13161","snapshot_observed_at":"2026-08-08T19:58:17.189295Z","title":"Cyberseceval 2: A wide-ranging cybersecurity evaluation suite for large language models.arXiv preprint arXiv:2404.13161, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.04317","last_updated":"2026-08-05T00:54:57Z","snapshot_observed_at":"2026-08-09T19:45:40.565565Z","submitted_at":"2026-08-05T00:54:57Z","title":"Trident : How to Break Deep Reinforcement Learning Cyber Defenses (Agentic)","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-08T19:58:17.189295Z"},"links":{"cited_paper":"/paper/2404.13161","citing_paper":"/paper/2608.04317"},"observation_digest":"sha256:a1377b0487f00f8a04fed2c0faf08d3544054d4732f48969d9198fabe64a74f2","observation_id":"a94a278f-1b97-4c27-a052-f8d65eea29d9","resolution":{"observed_at":"2026-08-08T19:58:17.189295Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.04724","last_updated":"2023-12-07T22:07:54Z","snapshot_observed_at":"2026-08-09T23:28:16.743355Z","submitted_at":"2023-12-07T22:07:54Z","title":"Purple Llama CyberSecEval: A Secure Coding Benchmark for Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.04724","snapshot_observed_at":"2026-08-08T19:58:17.193944Z","title":"Purple llama cyberseceval: A secure coding benchmark for language models.arXiv preprint arXiv:2312.04724, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.04317","last_updated":"2026-08-05T00:54:57Z","snapshot_observed_at":"2026-08-09T19:45:40.565565Z","submitted_at":"2026-08-05T00:54:57Z","title":"Trident : How to Break Deep Reinforcement Learning Cyber Defenses (Agentic)","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-08T19:58:17.193944Z"},"links":{"cited_paper":"/paper/2312.04724","citing_paper":"/paper/2608.04317"},"observation_digest":"sha256:2323f7845cfe3d40dff70d0ce5813792cc06dd0e06488939637338a8e0c06f7b","observation_id":"7cdc2bd7-d8d6-4bb1-8996-da6ea68649a7","resolution":{"observed_at":"2026-08-08T19:58:17.193944Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T19:58:18.233415Z","title":"Large language models are autonomous cyber defenders","venue":null,"work_id":"a7e6cb2d-a7a5-4a71-b7d2-f6492eaa0401","year":2025},"citing_paper":{"arxiv_id":"2608.04317","last_updated":"2026-08-05T00:54:57Z","snapshot_observed_at":"2026-08-09T19:45:40.565565Z","submitted_at":"2026-08-05T00:54:57Z","title":"Trident : How to Break Deep Reinforcement Learning Cyber Defenses (Agentic)","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-08T19:58:17.197620Z"},"links":{"citing_paper":"/paper/2608.04317"},"observation_digest":"sha256:f43de6d7c4ec1fe9a4ea7b2da91d98fc6fe02d3d59b3171f4d152ba5986c439c","observation_id":"66b4479a-f346-4677-b5e0-5a1b4346697f","resolution":{"observed_at":"2026-08-08T19:58:18.236818Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T19:58:17.200744Z","title":"Agentverse: Facilitating multi-agent collaboration and exploring emergent behaviors","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.04317","last_updated":"2026-08-05T00:54:57Z","snapshot_observed_at":"2026-08-09T19:45:40.565565Z","submitted_at":"2026-08-05T00:54:57Z","title":"Trident : How to Break Deep Reinforcement Learning Cyber Defenses (Agentic)","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-08T19:58:17.200744Z"},"links":{"citing_paper":"/paper/2608.04317"},"observation_digest":"sha256:7b9b4ef93d47449d0f8d40fd348fc0457170f816c055d1eea10fcec782ceef03","observation_id":"eafcbef2-bf1a-42ce-8839-962fd2b7ef32","resolution":{"observed_at":"2026-08-08T19:58:17.200744Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.14168","last_updated":"2021-11-18T00:23:45Z","snapshot_observed_at":"2026-08-07T01:45:38.840969Z","submitted_at":"2021-10-27T04:49:45Z","title":"Training Verifiers to Solve Math Word Problems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.14168","snapshot_observed_at":"2026-08-08T19:58:17.203952Z","title":"Training verifiers to solve math word problems.arXiv preprint arXiv:2110.14168, 2021","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.04317","last_updated":"2026-08-05T00:54:57Z","snapshot_observed_at":"2026-08-09T19:45:40.565565Z","submitted_at":"2026-08-05T00:54:57Z","title":"Trident : How to Break Deep Reinforcement Learning Cyber Defenses (Agentic)","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-08T19:58:17.203952Z"},"links":{"cited_paper":"/paper/2110.14168","citing_paper":"/paper/2608.04317"},"observation_digest":"sha256:3b5b4f58c1810415121c2f1c85caaa0c83899925c5e99c7539ba927fa72d6ce5","observation_id":"f56c22bb-c346-46b6-a51d-8999397414a7","resolution":{"observed_at":"2026-08-08T19:58:17.203952Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T19:58:18.219184Z","title":"PentestGPT: Evaluating and harnessing large language models for automated penetration testing","venue":null,"work_id":"57a39ed8-ff73-414d-b22c-623a614f6e5c","year":2024},"citing_paper":{"arxiv_id":"2608.04317","last_updated":"2026-08-05T00:54:57Z","snapshot_observed_at":"2026-08-09T19:45:40.565565Z","submitted_at":"2026-08-05T00:54:57Z","title":"Trident : How to Break Deep Reinforcement Learning Cyber Defenses (Agentic)","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-08T19:58:17.207606Z"},"links":{"citing_paper":"/paper/2608.04317"},"observation_digest":"sha256:0f013bf50b45b1dd00917cfd8e34cfa60bdd760717c779c3ad95562d0cff2661","observation_id":"c44250ce-64e6-41b6-9e34-c9837de6b25f","resolution":{"observed_at":"2026-08-08T19:58:18.222351Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.08144","last_updated":"2024-04-17T04:34:39Z","snapshot_observed_at":"2026-08-08T10:18:09.304124Z","submitted_at":"2024-04-11T22:07:19Z","title":"LLM Agents can Autonomously Exploit One-day Vulnerabilities","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.08144","snapshot_observed_at":"2026-08-08T19:58:17.210586Z","title":"Llm agents can autonomously exploit one-day vulnerabilities.arXiv preprint arXiv:2404.08144, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.04317","last_updated":"2026-08-05T00:54:57Z","snapshot_observed_at":"2026-08-09T19:45:40.565565Z","submitted_at":"2026-08-05T00:54:57Z","title":"Trident : How to Break Deep Reinforcement Learning Cyber Defenses (Agentic)","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-08T19:58:17.210586Z"},"links":{"cited_paper":"/paper/2404.08144","citing_paper":"/paper/2608.04317"},"observation_digest":"sha256:0797afee9a9242db0a5acc6686f5f2dce4e0f47350b1af06acb621a4afec4b26","observation_id":"20e8ebcb-43a6-4c2f-9524-793b567730e6","resolution":{"observed_at":"2026-08-08T19:58:17.210586Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.06664","last_updated":"2024-02-16T04:02:51Z","snapshot_observed_at":"2026-08-07T10:02:21.156103Z","submitted_at":"2024-02-06T14:46:08Z","title":"LLM Agents can Autonomously Hack Websites","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.06664","snapshot_observed_at":"2026-08-08T19:58:17.213871Z","title":"Llm agents can autonomously hack websites.arXiv preprint arXiv:2402.06664, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.04317","last_updated":"2026-08-05T00:54:57Z","snapshot_observed_at":"2026-08-09T19:45:40.565565Z","submitted_at":"2026-08-05T00:54:57Z","title":"Trident : How to Break Deep Reinforcement Learning Cyber Defenses (Agentic)","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-08T19:58:17.213871Z"},"links":{"cited_paper":"/paper/2402.06664","citing_paper":"/paper/2608.04317"},"observation_digest":"sha256:da5da7608082a3c78c86d72d0a4b3e0e505c2174febac5d95347adfa7fee807f","observation_id":"8d7de844-f4f5-43d7-aa20-28fb6659842a","resolution":{"observed_at":"2026-08-08T19:58:17.213871Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T19:58:18.210043Z","title":"Graphplanner: Graph- based agentic routing for LLMs","venue":null,"work_id":"38eebba8-0d3b-4362-a409-21f5d2fcb7e2","year":2026},"citing_paper":{"arxiv_id":"2608.04317","last_updated":"2026-08-05T00:54:57Z","snapshot_observed_at":"2026-08-09T19:45:40.565565Z","submitted_at":"2026-08-05T00:54:57Z","title":"Trident : How to Break Deep Reinforcement Learning Cyber Defenses (Agentic)","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-08T19:58:17.217256Z"},"links":{"citing_paper":"/paper/2608.04317"},"observation_digest":"sha256:5dd870ed232dc1a9376d31ba05d80d66e57d248ad07d3f99570e5ac1f540104f","observation_id":"537a98f3-3e25-4ac9-9f28-20ec16beef8b","resolution":{"observed_at":"2026-08-08T19:58:18.213523Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T19:58:18.200237Z","title":"Redcode: Risky code execution and generation benchmark for code agents","venue":null,"work_id":"e046bb4a-713f-4e05-b0ee-f7bde5590d0b","year":2024},"citing_paper":{"arxiv_id":"2608.04317","last_updated":"2026-08-05T00:54:57Z","snapshot_observed_at":"2026-08-09T19:45:40.565565Z","submitted_at":"2026-08-05T00:54:57Z","title":"Trident : How to Break Deep Reinforcement Learning Cyber Defenses (Agentic)","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-08T19:58:17.220501Z"},"links":{"citing_paper":"/paper/2608.04317"},"observation_digest":"sha256:b7ab8b107f7130c8e51f64d47638709e7326b00ae722eaa6f52f0012d23ef57a","observation_id":"8d073036-155f-4786-b95f-11dcadf22c59","resolution":{"observed_at":"2026-08-08T19:58:18.203990Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-08T19:58:17.223565Z","title":"Deepseek-r1: Incentivizing reasoning capability in llms via reinforcement learning.arXiv preprint arXiv:2501.12948, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.04317","last_updated":"2026-08-05T00:54:57Z","snapshot_observed_at":"2026-08-09T19:45:40.565565Z","submitted_at":"2026-08-05T00:54:57Z","title":"Trident : How to Break Deep Reinforcement Learning Cyber Defenses (Agentic)","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-08T19:58:17.223565Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2608.04317"},"observation_digest":"sha256:829cc1f6e274f0dec6c7ab178fb292498e27ef06db008a1c6bb32cbda5182732","observation_id":"39a0136a-f926-47b7-a4fa-5a049b9ef4b5","resolution":{"observed_at":"2026-08-08T19:58:17.223565Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T19:58:18.190393Z","title":"Getting pwn’d by ai: Penetration testing with large language models","venue":null,"work_id":"7844d8eb-efc3-461a-bc30-7907f465ed31","year":2023},"citing_paper":{"arxiv_id":"2608.04317","last_updated":"2026-08-05T00:54:57Z","snapshot_observed_at":"2026-08-09T19:45:40.565565Z","submitted_at":"2026-08-05T00:54:57Z","title":"Trident : How to Break Deep Reinforcement Learning Cyber Defenses (Agentic)","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-08T19:58:17.227059Z"},"links":{"citing_paper":"/paper/2608.04317"},"observation_digest":"sha256:3a24473b34f1b2466512cf061c6a54290c1ee6e74a581023ce78bd43e7eae1c3","observation_id":"392eb2c5-267a-48d7-8cfd-b33f5b60f0b6","resolution":{"observed_at":"2026-08-08T19:58:18.193871Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T19:58:18.179836Z","title":"Llms as hackers: Autonomous linux privilege escalation attacks.Empirical Software Engineering, 31(3):70, 2026","venue":null,"work_id":"7aaa88ef-cb4e-4034-804c-20e03ce38005","year":2026},"citing_paper":{"arxiv_id":"2608.04317","last_updated":"2026-08-05T00:54:57Z","snapshot_observed_at":"2026-08-09T19:45:40.565565Z","submitted_at":"2026-08-05T00:54:57Z","title":"Trident : How to Break Deep Reinforcement Learning Cyber Defenses (Agentic)","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-08T19:58:17.230065Z"},"links":{"citing_paper":"/paper/2608.04317"},"observation_digest":"sha256:421ce957edf85732270ae2ef043d373c42ec7c96541773c9478d4c43dba543ff","observation_id":"c775929a-b989-4410-9ac8-1cc62c818250","resolution":{"observed_at":"2026-08-08T19:58:18.183206Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T19:58:18.168292Z","title":"Deepmath-103k: A large-scale, challenging, decontaminated, and verifiable mathematical dataset for advancing reasoning","venue":null,"work_id":"ef63b1be-f1bc-43ef-a1a6-c5d906c6d058","year":2026},"citing_paper":{"arxiv_id":"2608.04317","last_updated":"2026-08-05T00:54:57Z","snapshot_observed_at":"2026-08-09T19:45:40.565565Z","submitted_at":"2026-08-05T00:54:57Z","title":"Trident : How to Break Deep Reinforcement Learning Cyber Defenses (Agentic)","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-08T19:58:17.233285Z"},"links":{"citing_paper":"/paper/2608.04317"},"observation_digest":"sha256:377b7b1b9f24d42b3b43eeb6522147d7c98d88dc9af776c9e0a109af39d4b864","observation_id":"a9a08bcc-f95d-4e36-9e3e-b8c4f572151a","resolution":{"observed_at":"2026-08-08T19:58:18.173065Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12186","last_updated":"2024-11-12T13:24:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-18T17:57:57Z","title":"Qwen2.5-Coder Technical Report","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12186","snapshot_observed_at":"2026-08-08T19:58:17.236382Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.04317","last_updated":"2026-08-05T00:54:57Z","snapshot_observed_at":"2026-08-09T19:45:40.565565Z","submitted_at":"2026-08-05T00:54:57Z","title":"Trident : How to Break Deep Reinforcement Learning Cyber Defenses (Agentic)","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-08T19:58:17.236382Z"},"links":{"cited_paper":"/paper/2409.12186","citing_paper":"/paper/2608.04317"},"observation_digest":"sha256:c9d825601a93669efd14eb78b39f21f974d160abe7bd18089163e5082c471bf0","observation_id":"c10c72e4-b6db-44d3-b056-381995d46494","resolution":{"observed_at":"2026-08-08T19:58:17.236382Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21276","last_updated":"2024-10-25T17:43:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-25T17:43:01Z","title":"GPT-4o System Card","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.21276","snapshot_observed_at":"2026-08-08T19:58:17.239797Z","title":"Gpt-4o system card.arXiv preprint arXiv:2410.21276, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.04317","last_updated":"2026-08-05T00:54:57Z","snapshot_observed_at":"2026-08-09T19:45:40.565565Z","submitted_at":"2026-08-05T00:54:57Z","title":"Trident : How to Break Deep Reinforcement Learning Cyber Defenses (Agentic)","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-08T19:58:17.239797Z"},"links":{"cited_paper":"/paper/2410.21276","citing_paper":"/paper/2608.04317"},"observation_digest":"sha256:7bc0c57016449afc8c623f2213b2709d4cc85ef5a3f1b1961a5d497fdcb84440","observation_id":"84a5e156-aac6-4e3a-88ed-2c2efa7cef9b","resolution":{"observed_at":"2026-08-08T19:58:17.239797Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T19:58:18.155008Z","title":"Agentic ai for cyber defense: Llm-guided hierarchical multi-agent reinforcement learning","venue":null,"work_id":"a1d5114b-2de5-4cb8-aa06-4b1f27b4730d","year":2025},"citing_paper":{"arxiv_id":"2608.04317","last_updated":"2026-08-05T00:54:57Z","snapshot_observed_at":"2026-08-09T19:45:40.565565Z","submitted_at":"2026-08-05T00:54:57Z","title":"Trident : How to Break Deep Reinforcement Learning Cyber Defenses (Agentic)","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-08T19:58:17.243121Z"},"links":{"citing_paper":"/paper/2608.04317"},"observation_digest":"sha256:211baec5e4bc222fd76203b390823531f38766d9b849046175d59664a8f8064a","observation_id":"28054fda-b27f-4aaf-8f4b-81dd9ae96b37","resolution":{"observed_at":"2026-08-08T19:58:18.160033Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T19:58:18.144891Z","title":"Search-r1: Training LLMs to reason and leverage search engines with reinforcement learning","venue":null,"work_id":"6ab48f04-bdd5-4fb8-95bc-7deddf491585","year":2025},"citing_paper":{"arxiv_id":"2608.04317","last_updated":"2026-08-05T00:54:57Z","snapshot_observed_at":"2026-08-09T19:45:40.565565Z","submitted_at":"2026-08-05T00:54:57Z","title":"Trident : How to Break Deep Reinforcement Learning Cyber Defenses (Agentic)","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-08T19:58:17.246095Z"},"links":{"citing_paper":"/paper/2608.04317"},"observation_digest":"sha256:4f54ea429b64285fa4c9cd0817b236a4a2cd1702614a523643ec4ca59b02aae9","observation_id":"828afaeb-c042-4d3c-8910-8c58d6057b1c","resolution":{"observed_at":"2026-08-08T19:58:18.148367Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T19:58:17.249096Z","title":"Exploring the efficacy of multi-agent reinforcement learning for autonomous cyber defence: A cage challenge 4 perspective","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.04317","last_updated":"2026-08-05T00:54:57Z","snapshot_observed_at":"2026-08-09T19:45:40.565565Z","submitted_at":"2026-08-05T00:54:57Z","title":"Trident : How to Break Deep Reinforcement Learning Cyber Defenses (Agentic)","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-08T19:58:17.249096Z"},"links":{"citing_paper":"/paper/2608.04317"},"observation_digest":"sha256:24cf20e2b7528766044787d814af6d0ea35a37dab3e47b80c94cea797ddc6c66","observation_id":"5157025d-7461-46e7-b441-5d66539fec3a","resolution":{"observed_at":"2026-08-08T19:58:17.249096Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T19:58:17.252347Z","title":"Automated cyber defense with generalizable graph-based reinforcement learning agents.arXiv preprint arXiv:2509.16151, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.04317","last_updated":"2026-08-05T00:54:57Z","snapshot_observed_at":"2026-08-09T19:45:40.565565Z","submitted_at":"2026-08-05T00:54:57Z","title":"Trident : How to Break Deep Reinforcement Learning Cyber Defenses (Agentic)","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-08T19:58:17.252347Z"},"links":{"citing_paper":"/paper/2608.04317"},"observation_digest":"sha256:96505727c730fd0968ef7715fc220f5c4ebeca61e609017b91d44ab20f665dbf","observation_id":"e6e1b05a-f842-4dbb-b1e7-d144c3b9786f","resolution":{"observed_at":"2026-08-08T19:58:17.252347Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T19:58:17.255777Z","title":"Large language models are zero-shot reasoners.Advances in neural information processing systems, 35:22199–22213, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.04317","last_updated":"2026-08-05T00:54:57Z","snapshot_observed_at":"2026-08-09T19:45:40.565565Z","submitted_at":"2026-08-05T00:54:57Z","title":"Trident : How to Break Deep Reinforcement Learning Cyber Defenses (Agentic)","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-08T19:58:17.255777Z"},"links":{"citing_paper":"/paper/2608.04317"},"observation_digest":"sha256:067647ada7b17ad625056c6725301c4fffce432fdacf50175008bc081bb6ce85","observation_id":"eea105c7-6006-490e-be8b-80e29d897860","resolution":{"observed_at":"2026-08-08T19:58:17.255777Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T19:58:17.258881Z","title":"Gonzalez, Hao Zhang, and Ion Stoica","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.04317","last_updated":"2026-08-05T00:54:57Z","snapshot_observed_at":"2026-08-09T19:45:40.565565Z","submitted_at":"2026-08-05T00:54:57Z","title":"Trident : How to Break Deep Reinforcement Learning Cyber Defenses (Agentic)","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-08T19:58:17.258881Z"},"links":{"citing_paper":"/paper/2608.04317"},"observation_digest":"sha256:5ecc5741d7b69fe6f0b8359975588a22e2d519ea998d55df2bb0fc41ce44ba0f","observation_id":"002fa239-7cad-40a3-9abc-bd5b8d3cfe68","resolution":{"observed_at":"2026-08-08T19:58:17.258881Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T19:58:17.907291Z","title":"In-the-flow agentic system optimization for effective planning and tool use","venue":null,"work_id":"6f05c939-066e-42ea-bdc6-6c6035209e32","year":2026},"citing_paper":{"arxiv_id":"2608.04317","last_updated":"2026-08-05T00:54:57Z","snapshot_observed_at":"2026-08-09T19:45:40.565565Z","submitted_at":"2026-08-05T00:54:57Z","title":"Trident : How to Break Deep Reinforcement Learning Cyber Defenses (Agentic)","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-08T19:58:17.261962Z"},"links":{"citing_paper":"/paper/2608.04317"},"observation_digest":"sha256:c7618e1bdb2e0ec265a787500029b5d348f1d2bc23746c8407e087723bf9b571","observation_id":"e9181f4b-d3ac-47de-9116-2de7e18ab6a0","resolution":{"observed_at":"2026-08-08T19:58:17.910451Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T19:58:17.264984Z","title":"Code as policies: Language model programs for embodied control","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.04317","last_updated":"2026-08-05T00:54:57Z","snapshot_observed_at":"2026-08-09T19:45:40.565565Z","submitted_at":"2026-08-05T00:54:57Z","title":"Trident : How to Break Deep Reinforcement Learning Cyber Defenses (Agentic)","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-08T19:58:17.264984Z"},"links":{"citing_paper":"/paper/2608.04317"},"observation_digest":"sha256:1d1a98fc4b70f733cb9197a50db1400ecf1f4f538fb4b70723c1086c6e9e5b55","observation_id":"122e0f90-d9be-4245-9c27-eee78120d9bd","resolution":{"observed_at":"2026-08-08T19:58:17.264984Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T19:58:17.892830Z","title":"Et-bert: A contextualized datagram representation with pre-training transformers for encrypted traffic classification","venue":null,"work_id":"b673d63a-cf56-4319-9ef9-b4dc23ac49da","year":2022},"citing_paper":{"arxiv_id":"2608.04317","last_updated":"2026-08-05T00:54:57Z","snapshot_observed_at":"2026-08-09T19:45:40.565565Z","submitted_at":"2026-08-05T00:54:57Z","title":"Trident : How to Break Deep Reinforcement Learning Cyber Defenses (Agentic)","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-08T19:58:17.267969Z"},"links":{"citing_paper":"/paper/2608.04317"},"observation_digest":"sha256:b6d0b31beb581ea2e46c3e53d5f32d1b8375a83595a70df0045142b96473c207","observation_id":"74634654-66b4-4099-b9a5-9ac2f6dd52b0","resolution":{"observed_at":"2026-08-08T19:58:17.896149Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T19:58:17.883263Z","title":"Cyberbench: A multi-task benchmark for evaluating large language models in cybersecurity","venue":null,"work_id":"10ea75ff-f95a-4574-86f7-9b5068ed371b","year":2024},"citing_paper":{"arxiv_id":"2608.04317","last_updated":"2026-08-05T00:54:57Z","snapshot_observed_at":"2026-08-09T19:45:40.565565Z","submitted_at":"2026-08-05T00:54:57Z","title":"Trident : How to Break Deep Reinforcement Learning Cyber Defenses (Agentic)","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-08T19:58:17.271027Z"},"links":{"citing_paper":"/paper/2608.04317"},"observation_digest":"sha256:8bf1d98b9c3018901fe39ca63c919cb5775adc4500acec986b21772a48d83e84","observation_id":"602324bb-d5ad-459d-9e75-1357f935d447","resolution":{"observed_at":"2026-08-08T19:58:17.886939Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T19:58:17.273922Z","title":"Visual-rft: Visual reinforcement fine-tuning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.04317","last_updated":"2026-08-05T00:54:57Z","snapshot_observed_at":"2026-08-09T19:45:40.565565Z","submitted_at":"2026-08-05T00:54:57Z","title":"Trident : How to Break Deep Reinforcement Learning Cyber Defenses (Agentic)","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-08T19:58:17.273922Z"},"links":{"citing_paper":"/paper/2608.04317"},"observation_digest":"sha256:6be9733b4981e827fe306507f8fd36a5cf9304dda495c84a96b82e0023dd14b2","observation_id":"7addd55e-ce6c-400f-837c-9d12548168d0","resolution":{"observed_at":"2026-08-08T19:58:17.273922Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T19:58:17.869351Z","title":"Contrasting centralized and decentralized critics in multi-agent reinforcement learning","venue":null,"work_id":"2fa5d8f8-b4fb-4658-af11-ce0837ba0128","year":2021},"citing_paper":{"arxiv_id":"2608.04317","last_updated":"2026-08-05T00:54:57Z","snapshot_observed_at":"2026-08-09T19:45:40.565565Z","submitted_at":"2026-08-05T00:54:57Z","title":"Trident : How to Break Deep Reinforcement Learning Cyber Defenses (Agentic)","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-08T19:58:17.276936Z"},"links":{"citing_paper":"/paper/2608.04317"},"observation_digest":"sha256:1774090eb912afae6bc0a73e155569dfe1b69af16ae33a0f5f33b9f36a43e57d","observation_id":"fe77814f-b49e-4ca1-a9d0-27a9fc5cc743","resolution":{"observed_at":"2026-08-08T19:58:17.872569Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T19:58:17.279999Z","title":"Eureka: Human-level reward design via coding large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.04317","last_updated":"2026-08-05T00:54:57Z","snapshot_observed_at":"2026-08-09T19:45:40.565565Z","submitted_at":"2026-08-05T00:54:57Z","title":"Trident : How to Break Deep Reinforcement Learning Cyber Defenses (Agentic)","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-08T19:58:17.279999Z"},"links":{"citing_paper":"/paper/2608.04317"},"observation_digest":"sha256:32b26b943ab0c7b5f16a359e6d2689578a513dcf3d267fadcacdeae67b9704a0","observation_id":"3113a622-7603-43f8-a95c-d5faabd251b3","resolution":{"observed_at":"2026-08-08T19:58:17.279999Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T19:58:17.283080Z","title":"Ray: A distributed framework for emerging {AI} applications","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2608.04317","last_updated":"2026-08-05T00:54:57Z","snapshot_observed_at":"2026-08-09T19:45:40.565565Z","submitted_at":"2026-08-05T00:54:57Z","title":"Trident : How to Break Deep Reinforcement Learning Cyber Defenses (Agentic)","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-08T19:58:17.283080Z"},"links":{"citing_paper":"/paper/2608.04317"},"observation_digest":"sha256:770f29425766a08ff931b70c89d49bc5287128674794b55531ec1ecf2d0ba7a1","observation_id":"19bfc18e-0300-400e-9f37-06b0db33acbd","resolution":{"observed_at":"2026-08-08T19:58:17.283080Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T19:58:17.850124Z","title":"Experience with emerald to date","venue":null,"work_id":"c69a603d-6642-4d36-b6e1-f63a303cee95","year":1999},"citing_paper":{"arxiv_id":"2608.04317","last_updated":"2026-08-05T00:54:57Z","snapshot_observed_at":"2026-08-09T19:45:40.565565Z","submitted_at":"2026-08-05T00:54:57Z","title":"Trident : How to Break Deep Reinforcement Learning Cyber Defenses (Agentic)","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-08T19:58:17.285979Z"},"links":{"citing_paper":"/paper/2608.04317"},"observation_digest":"sha256:66714be0fc58d8cc22a32232c323ea22b2e2f4f03a1bc9d5e7a3c1b31cfe49a5","observation_id":"3457e4e5-f661-4b23-8580-db69c17dbeaf","resolution":{"observed_at":"2026-08-08T19:58:17.853501Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T19:58:17.840407Z","title":"Towards a high fidelity training environment for autonomous cyber defense agents","venue":null,"work_id":"458279ee-dd1b-4b1a-9c14-b92eeae5ac0b","year":2024},"citing_paper":{"arxiv_id":"2608.04317","last_updated":"2026-08-05T00:54:57Z","snapshot_observed_at":"2026-08-09T19:45:40.565565Z","submitted_at":"2026-08-05T00:54:57Z","title":"Trident : How to Break Deep Reinforcement Learning Cyber Defenses (Agentic)","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-08T19:58:17.289324Z"},"links":{"citing_paper":"/paper/2608.04317"},"observation_digest":"sha256:3c4cecd96ae2bfc006d57b976e61fabec69774f4314a62ddc3b0a983d9bc8d25","observation_id":"bbccf353-cf5e-42ab-b437-e87fa106e2e5","resolution":{"observed_at":"2026-08-08T19:58:17.843871Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-08T19:58:17.292586Z","title":"Proximal policy optimization algorithms.arXiv preprint arXiv:1707.06347, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2608.04317","last_updated":"2026-08-05T00:54:57Z","snapshot_observed_at":"2026-08-09T19:45:40.565565Z","submitted_at":"2026-08-05T00:54:57Z","title":"Trident : How to Break Deep Reinforcement Learning Cyber Defenses (Agentic)","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-08T19:58:17.292586Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2608.04317"},"observation_digest":"sha256:cca604bffea7054e02039e2a6c3a4de8af47f39dae91ce8bf397a86dbcdbf26c","observation_id":"6de97952-a83d-4464-a26e-8cf90eb500df","resolution":{"observed_at":"2026-08-08T19:58:17.292586Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T19:58:17.830867Z","title":"Nyu ctf bench: A scalable open-source benchmark dataset for evaluating llms in offensive security","venue":null,"work_id":"ed06122d-bb90-4756-ae98-6a941b8eef01","year":2024},"citing_paper":{"arxiv_id":"2608.04317","last_updated":"2026-08-05T00:54:57Z","snapshot_observed_at":"2026-08-09T19:45:40.565565Z","submitted_at":"2026-08-05T00:54:57Z","title":"Trident : How to Break Deep Reinforcement Learning Cyber Defenses (Agentic)","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-08T19:58:17.295843Z"},"links":{"citing_paper":"/paper/2608.04317"},"observation_digest":"sha256:bf8596c5b2fe6e02f3ab121e8a2727b2c44617c4ca27243afee2782b0f9e994f","observation_id":"a004ecfb-09e6-44c3-986f-43b6cbf9ea81","resolution":{"observed_at":"2026-08-08T19:58:17.834168Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-08T19:58:17.298765Z","title":"Deepseekmath: Pushing the limits of mathematical reasoning in open language models.arXiv preprint arXiv:2402.03300, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.04317","last_updated":"2026-08-05T00:54:57Z","snapshot_observed_at":"2026-08-09T19:45:40.565565Z","submitted_at":"2026-08-05T00:54:57Z","title":"Trident : How to Break Deep Reinforcement Learning Cyber Defenses (Agentic)","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-08T19:58:17.298765Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2608.04317"},"observation_digest":"sha256:ec26d36c78ec74f8c8b96c306cefd1b8a059c3b6f473b0a60310940e32467cd1","observation_id":"3a10cc6c-cbfd-46c2-a99b-629db9076462","resolution":{"observed_at":"2026-08-08T19:58:17.298765Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T19:58:17.301997Z","title":"Hybridflow: A flexible and efficient rlhf framework","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.04317","last_updated":"2026-08-05T00:54:57Z","snapshot_observed_at":"2026-08-09T19:45:40.565565Z","submitted_at":"2026-08-05T00:54:57Z","title":"Trident : How to Break Deep Reinforcement Learning Cyber Defenses (Agentic)","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-08T19:58:17.301997Z"},"links":{"citing_paper":"/paper/2608.04317"},"observation_digest":"sha256:ef5611195496c49c9f2b762f02cf47bf1338ee932d7ee1ae08eb9c3a378685dd","observation_id":"97c601a8-7810-4d7f-93d1-c46ca867f66b","resolution":{"observed_at":"2026-08-08T19:58:17.301997Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T19:58:17.816272Z","title":"Hierarchical multi-agent reinforcement learning for cyber network defense.Reinforcement Learning Journal, 6:790–810, 2025","venue":null,"work_id":"0ca51d85-0136-4d83-b297-417d20b373ed","year":2025},"citing_paper":{"arxiv_id":"2608.04317","last_updated":"2026-08-05T00:54:57Z","snapshot_observed_at":"2026-08-09T19:45:40.565565Z","submitted_at":"2026-08-05T00:54:57Z","title":"Trident : How to Break Deep Reinforcement Learning Cyber Defenses (Agentic)","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-08T19:58:17.305358Z"},"links":{"citing_paper":"/paper/2608.04317"},"observation_digest":"sha256:74c84b1da27f70b72288e686a6361739fce8c08de980a44e36844aa965e96c58","observation_id":"b6fbeb53-181b-4e61-9d1c-dbe37dd0d1ce","resolution":{"observed_at":"2026-08-08T19:58:17.819801Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T19:58:17.806875Z","title":"A taxonomy of intrusion response systems","venue":null,"work_id":"396cd778-5fc5-4131-b61f-298d6e030251","year":2007},"citing_paper":{"arxiv_id":"2608.04317","last_updated":"2026-08-05T00:54:57Z","snapshot_observed_at":"2026-08-09T19:45:40.565565Z","submitted_at":"2026-08-05T00:54:57Z","title":"Trident : How to Break Deep Reinforcement Learning Cyber Defenses (Agentic)","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-08T19:58:17.308716Z"},"links":{"citing_paper":"/paper/2608.04317"},"observation_digest":"sha256:7265b57417506edbf83bb8c3b79171ea33fdaa22786576d2ba2e7be054d9d7c8","observation_id":"0d1bded1-97d5-40eb-8495-315f36c22d2b","resolution":{"observed_at":"2026-08-08T19:58:17.810253Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T19:58:17.797317Z","title":"Redsage: A cybersecurity generalist LLM","venue":null,"work_id":"ea5084db-21ee-4c7e-bd25-1c103a1e1a91","year":2026},"citing_paper":{"arxiv_id":"2608.04317","last_updated":"2026-08-05T00:54:57Z","snapshot_observed_at":"2026-08-09T19:45:40.565565Z","submitted_at":"2026-08-05T00:54:57Z","title":"Trident : How to Break Deep Reinforcement Learning Cyber Defenses (Agentic)","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-08T19:58:17.311692Z"},"links":{"citing_paper":"/paper/2608.04317"},"observation_digest":"sha256:5fc1b59fba27a1eb83cf4247e3b397baef284b4ea113595504d99036352e4e36","observation_id":"2f99b4cb-176e-44b6-8d9e-9af9daa5eac8","resolution":{"observed_at":"2026-08-08T19:58:17.800806Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T19:58:17.787004Z","title":"Cyberbattlesim, 2021","venue":null,"work_id":"71c9d4be-6271-4c08-8930-ecd2c2cd43bf","year":2021},"citing_paper":{"arxiv_id":"2608.04317","last_updated":"2026-08-05T00:54:57Z","snapshot_observed_at":"2026-08-09T19:45:40.565565Z","submitted_at":"2026-08-05T00:54:57Z","title":"Trident : How to Break Deep Reinforcement Learning Cyber Defenses (Agentic)","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-08T19:58:17.314759Z"},"links":{"citing_paper":"/paper/2608.04317"},"observation_digest":"sha256:fb6018b68a5d470ea9b6777d07b4542012dd86f2ef15d502484bc84d44a3cf09","observation_id":"294053bb-943e-470b-9ada-fd18ddb5bad4","resolution":{"observed_at":"2026-08-08T19:58:17.791420Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T19:58:17.317755Z","title":"Qwen2.5: A party of foundation models, September 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.04317","last_updated":"2026-08-05T00:54:57Z","snapshot_observed_at":"2026-08-09T19:45:40.565565Z","submitted_at":"2026-08-05T00:54:57Z","title":"Trident : How to Break Deep Reinforcement Learning Cyber Defenses (Agentic)","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-08T19:58:17.317755Z"},"links":{"citing_paper":"/paper/2608.04317"},"observation_digest":"sha256:3125504223be5d0982315ac030ac92a307cc6e17584961f54b4649df2f79d3cf","observation_id":"1782e2f7-4dd3-4e2a-9cab-129cb7519f89","resolution":{"observed_at":"2026-08-08T19:58:17.317755Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.01605","last_updated":"2024-09-06T18:17:07Z","snapshot_observed_at":"2026-08-09T15:49:58.734883Z","submitted_at":"2024-08-02T23:47:27Z","title":"CYBERSECEVAL 3: Advancing the Evaluation of Cybersecurity Risks and Capabilities in Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.01605","snapshot_observed_at":"2026-08-08T19:58:17.320654Z","title":"Cyberseceval 3: Advancing the evaluation of cybersecurity risks and capabilities in large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.04317","last_updated":"2026-08-05T00:54:57Z","snapshot_observed_at":"2026-08-09T19:45:40.565565Z","submitted_at":"2026-08-05T00:54:57Z","title":"Trident : How to Break Deep Reinforcement Learning Cyber Defenses (Agentic)","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-08T19:58:17.320654Z"},"links":{"cited_paper":"/paper/2408.01605","citing_paper":"/paper/2608.04317"},"observation_digest":"sha256:b269e1f5a76ed91df2a18201882d55602d529efeca12b58c1b3427a9f98dcebd","observation_id":"52f80ab4-0d91-46e9-be5e-44d05215a9f5","resolution":{"observed_at":"2026-08-08T19:58:17.320654Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.08865","last_updated":"2026-04-10T01:58:21Z","snapshot_observed_at":"2026-07-06T22:57:55.179136Z","submitted_at":"2026-04-10T01:58:21Z","title":"SPPO: Sequence-Level PPO for Long-Horizon Reasoning Tasks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.08865","snapshot_observed_at":"2026-08-08T19:58:17.324049Z","title":"Sppo: Sequence-level ppo for long-horizon reasoning tasks.arXiv preprint arXiv:2604.08865, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.04317","last_updated":"2026-08-05T00:54:57Z","snapshot_observed_at":"2026-08-09T19:45:40.565565Z","submitted_at":"2026-08-05T00:54:57Z","title":"Trident : How to Break Deep Reinforcement Learning Cyber Defenses (Agentic)","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-08T19:58:17.324049Z"},"links":{"cited_paper":"/paper/2604.08865","citing_paper":"/paper/2608.04317"},"observation_digest":"sha256:c27da8e4ef0b71d2c98cc1ee9219aaa9fc56043e57e8d9e42d2187740deebd32","observation_id":"c66d7f38-f65f-4667-bcd0-2e9622ff5b4e","resolution":{"observed_at":"2026-08-08T19:58:17.324049Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T19:58:17.772919Z","title":"SymRTLO: Enhancing RTL code optimization with LLMs and neuron-inspired symbolic reasoning","venue":null,"work_id":"286bb86c-583d-4240-9f99-c862b5d8ade2","year":2026},"citing_paper":{"arxiv_id":"2608.04317","last_updated":"2026-08-05T00:54:57Z","snapshot_observed_at":"2026-08-09T19:45:40.565565Z","submitted_at":"2026-08-05T00:54:57Z","title":"Trident : How to Break Deep Reinforcement Learning Cyber Defenses (Agentic)","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-08T19:58:17.327331Z"},"links":{"citing_paper":"/paper/2608.04317"},"observation_digest":"sha256:5015abf0fb54cf0a30767c10d43a911056a498d1e803d5cf83bf96dd32a6e657","observation_id":"2c23d796-9356-45ec-a517-60c7e6bfa970","resolution":{"observed_at":"2026-08-08T19:58:17.776191Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T19:58:17.330596Z","title":"Cyber- gym: Evaluating AI agents’ real-world cybersecurity capabilities at scale","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.04317","last_updated":"2026-08-05T00:54:57Z","snapshot_observed_at":"2026-08-09T19:45:40.565565Z","submitted_at":"2026-08-05T00:54:57Z","title":"Trident : How to Break Deep Reinforcement Learning Cyber Defenses (Agentic)","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-08T19:58:17.330596Z"},"links":{"citing_paper":"/paper/2608.04317"},"observation_digest":"sha256:fded9ca68674387e6ccbc1cba1f9205011633262866500951635d75b947a4a42","observation_id":"5dfeadbe-4bab-4196-a7e0-b38991215f8c","resolution":{"observed_at":"2026-08-08T19:58:17.330596Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T19:58:17.758962Z","title":"SWE-RL: Advancing LLM reasoning via reinforcement learning on open software evolution","venue":null,"work_id":"762b8752-83b5-4ddc-925d-1b24efce1cb0","year":2025},"citing_paper":{"arxiv_id":"2608.04317","last_updated":"2026-08-05T00:54:57Z","snapshot_observed_at":"2026-08-09T19:45:40.565565Z","submitted_at":"2026-08-05T00:54:57Z","title":"Trident : How to Break Deep Reinforcement Learning Cyber Defenses (Agentic)","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-08T19:58:17.333659Z"},"links":{"citing_paper":"/paper/2608.04317"},"observation_digest":"sha256:bb02f1a087fbe55d0ef34fa93b54b0552b3f8875d5be357c873c7f195d7117ea","observation_id":"7d765deb-4598-47d6-9abe-0b9c9fe38835","resolution":{"observed_at":"2026-08-08T19:58:17.762294Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T19:58:17.749698Z","title":"Autogen: Enabling next-gen LLM applications via multi-agent conversations","venue":null,"work_id":"9b993ee4-272a-451e-bcb3-830ff0ee5da5","year":2024},"citing_paper":{"arxiv_id":"2608.04317","last_updated":"2026-08-05T00:54:57Z","snapshot_observed_at":"2026-08-09T19:45:40.565565Z","submitted_at":"2026-08-05T00:54:57Z","title":"Trident : How to Break Deep Reinforcement Learning Cyber Defenses (Agentic)","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-08T19:58:17.336740Z"},"links":{"citing_paper":"/paper/2608.04317"},"observation_digest":"sha256:34092bd36e4c1b38ce9e62797ddeae39d05aa2df368fe6c14e97e7946f5bafe8","observation_id":"7967ed37-304e-4d30-8fef-a0d5f8595db7","resolution":{"observed_at":"2026-08-08T19:58:17.752947Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.10671","last_updated":"2024-09-10T13:25:53Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-07-15T12:35:42Z","title":"Qwen2 Technical Report","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.10671","snapshot_observed_at":"2026-08-08T19:58:17.339747Z","title":"Qwen2 technical report.arXiv preprint arXiv:2407.10671, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.04317","last_updated":"2026-08-05T00:54:57Z","snapshot_observed_at":"2026-08-09T19:45:40.565565Z","submitted_at":"2026-08-05T00:54:57Z","title":"Trident : How to Break Deep Reinforcement Learning Cyber Defenses (Agentic)","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-08T19:58:17.339747Z"},"links":{"cited_paper":"/paper/2407.10671","citing_paper":"/paper/2608.04317"},"observation_digest":"sha256:99010ecbd9e064562249f59c20201e67e87ea0f919e736ac601549d8a5431c83","observation_id":"eee7a847-1c5c-464e-8a27-af119d650e66","resolution":{"observed_at":"2026-08-08T19:58:17.339747Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T19:58:17.343099Z","title":"Intercode: Standardizing and benchmarking interactive coding with execution feedback.Advances in Neural Information Processing Systems, 36:23826–23854, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.04317","last_updated":"2026-08-05T00:54:57Z","snapshot_observed_at":"2026-08-09T19:45:40.565565Z","submitted_at":"2026-08-05T00:54:57Z","title":"Trident : How to Break Deep Reinforcement Learning Cyber Defenses (Agentic)","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-08T19:58:17.343099Z"},"links":{"citing_paper":"/paper/2608.04317"},"observation_digest":"sha256:77c875b34d8aa258e4cb5ac360fe1da82aeb4ce8ac9050e6ce86edb83835331f","observation_id":"c3698d0f-5488-44a5-81a1-c9642f22a97c","resolution":{"observed_at":"2026-08-08T19:58:17.343099Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T19:58:17.346037Z","title":"React: Synergizing reasoning and acting in language models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.04317","last_updated":"2026-08-05T00:54:57Z","snapshot_observed_at":"2026-08-09T19:45:40.565565Z","submitted_at":"2026-08-05T00:54:57Z","title":"Trident : How to Break Deep Reinforcement Learning Cyber Defenses (Agentic)","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-08T19:58:17.346037Z"},"links":{"citing_paper":"/paper/2608.04317"},"observation_digest":"sha256:84e880c695b1afd95bfc8987e8b28387470df85330da541e75a18491276d3a86","observation_id":"f1dc883e-3319-46a9-bdee-54080f81ded9","resolution":{"observed_at":"2026-08-08T19:58:17.346037Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T19:58:17.730744Z","title":"Primus: A pioneering collection of open-source datasets for cybersecurity LLM training","venue":null,"work_id":"df7ea47e-91ad-4266-b1e4-607be8c3df74","year":2025},"citing_paper":{"arxiv_id":"2608.04317","last_updated":"2026-08-05T00:54:57Z","snapshot_observed_at":"2026-08-09T19:45:40.565565Z","submitted_at":"2026-08-05T00:54:57Z","title":"Trident : How to Break Deep Reinforcement Learning Cyber Defenses (Agentic)","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-08T19:58:17.348903Z"},"links":{"citing_paper":"/paper/2608.04317"},"observation_digest":"sha256:6a2d0c2ba1ba398f972c508704a02298ea8ea7efb49d652929078cc8803a6ea1","observation_id":"1e522d46-fdde-43c2-bcf0-37c6e7d88933","resolution":{"observed_at":"2026-08-08T19:58:17.734052Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T19:58:17.721614Z","title":"ACECODER: Acing coder RL via automated test-case synthesis","venue":null,"work_id":"cdf74e3c-2a29-4aa8-be5a-425b3b5b3938","year":2025},"citing_paper":{"arxiv_id":"2608.04317","last_updated":"2026-08-05T00:54:57Z","snapshot_observed_at":"2026-08-09T19:45:40.565565Z","submitted_at":"2026-08-05T00:54:57Z","title":"Trident : How to Break Deep Reinforcement Learning Cyber Defenses (Agentic)","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-08T19:58:17.351778Z"},"links":{"citing_paper":"/paper/2608.04317"},"observation_digest":"sha256:8ddcae35a5ebb1184024a87b3064db48ac0f8c9187acce3afa2e063681563d43","observation_id":"1caec6f9-8983-4b60-8d5d-737a854fc042","resolution":{"observed_at":"2026-08-08T19:58:17.724919Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T19:58:17.354780Z","title":"Ho, and Percy Liang","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.04317","last_updated":"2026-08-05T00:54:57Z","snapshot_observed_at":"2026-08-09T19:45:40.565565Z","submitted_at":"2026-08-05T00:54:57Z","title":"Trident : How to Break Deep Reinforcement Learning Cyber Defenses (Agentic)","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-08T19:58:17.354780Z"},"links":{"citing_paper":"/paper/2608.04317"},"observation_digest":"sha256:19dc164e68c1e17e72d0d0fbaa6471cbb4e558ab703252789f2ba7a1931c9bd6","observation_id":"367b9b5e-445a-46ef-b1b6-e52272cd4fa2","resolution":{"observed_at":"2026-08-08T19:58:17.354780Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T19:58:17.707098Z","title":"Abdi, William Blum, and Muhammad Abdul-Mageed","venue":null,"work_id":"b9fba59f-b636-4e6c-8fd0-01b14c947a1e","year":2025},"citing_paper":{"arxiv_id":"2608.04317","last_updated":"2026-08-05T00:54:57Z","snapshot_observed_at":"2026-08-09T19:45:40.565565Z","submitted_at":"2026-08-05T00:54:57Z","title":"Trident : How to Break Deep Reinforcement Learning Cyber Defenses (Agentic)","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-08T19:58:17.357824Z"},"links":{"citing_paper":"/paper/2608.04317"},"observation_digest":"sha256:e5005ebeaafa6d4328200b97a9dc649fcab4fbef389312a8340c089825b7aa4f","observation_id":"13fc7108-c6b0-42d2-9814-7d4992243321","resolution":{"observed_at":"2026-08-08T19:58:17.710547Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T19:58:17.697553Z","title":"Yet another traffic classifier: A masked autoencoder based traffic transformer with multi- level flow representation","venue":null,"work_id":"1e3345fa-9be8-4862-a409-0b27b131f5a4","year":2023},"citing_paper":{"arxiv_id":"2608.04317","last_updated":"2026-08-05T00:54:57Z","snapshot_observed_at":"2026-08-09T19:45:40.565565Z","submitted_at":"2026-08-05T00:54:57Z","title":"Trident : How to Break Deep Reinforcement Learning Cyber Defenses (Agentic)","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-08T19:58:17.360906Z"},"links":{"citing_paper":"/paper/2608.04317"},"observation_digest":"sha256:ae7183df42c7ae6b2ad425e47692a17f70b84f04433768ab19dc3dfd703a3486","observation_id":"e13e38df-282a-43f7-a6e7-425f58fe3047","resolution":{"observed_at":"2026-08-08T19:58:17.700836Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T19:58:17.687793Z","title":"Curran Associates Inc., Red Hook, NY , USA, 2019","venue":null,"work_id":"32cc2d5f-9394-4551-84e3-8763c6cfa585","year":2019},"citing_paper":{"arxiv_id":"2608.04317","last_updated":"2026-08-05T00:54:57Z","snapshot_observed_at":"2026-08-09T19:45:40.565565Z","submitted_at":"2026-08-05T00:54:57Z","title":"Trident : How to Break Deep Reinforcement Learning Cyber Defenses (Agentic)","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-08T19:58:17.363877Z"},"links":{"citing_paper":"/paper/2608.04317"},"observation_digest":"sha256:ca85f487b48e4b049912358ecf82322b0079466555319ec20330baa81c46f505","observation_id":"0ad2c876-7da4-447a-9c50-02f548644f98","resolution":{"observed_at":"2026-08-08T19:58:17.690889Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T19:58:17.678020Z","title":"More than just functional: LLM-as-a-critique for efficient code generation","venue":null,"work_id":"bc47210f-ca11-43bf-b6de-995596ed6b13","year":2026},"citing_paper":{"arxiv_id":"2608.04317","last_updated":"2026-08-05T00:54:57Z","snapshot_observed_at":"2026-08-09T19:45:40.565565Z","submitted_at":"2026-08-05T00:54:57Z","title":"Trident : How to Break Deep Reinforcement Learning Cyber Defenses (Agentic)","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-08T19:58:17.366857Z"},"links":{"citing_paper":"/paper/2608.04317"},"observation_digest":"sha256:a931e4986a45038ebd3732c9891b43c2b5a7e20d4a61ee7cfd8237a81603dac7","observation_id":"7c3dd15d-4a6b-4b36-974e-70e9254d75d6","resolution":{"observed_at":"2026-08-08T19:58:17.681374Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T19:58:17.668040Z","title":"CVE-bench: A benchmark for AI agents’ ability to exploit real-world web application vulnerabilities","venue":null,"work_id":"fe767653-df9e-4ee3-9c6a-9e164cf337a0","year":2025},"citing_paper":{"arxiv_id":"2608.04317","last_updated":"2026-08-05T00:54:57Z","snapshot_observed_at":"2026-08-09T19:45:40.565565Z","submitted_at":"2026-08-05T00:54:57Z","title":"Trident : How to Break Deep Reinforcement Learning Cyber Defenses (Agentic)","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-08T19:58:17.369963Z"},"links":{"citing_paper":"/paper/2608.04317"},"observation_digest":"sha256:c906d7b5c3c4053f8647b1655b72126309ce94dd95dcbca17e5c5a3dd76ad5e8","observation_id":"9750a2ff-fd21-4e2c-8c61-455322623ec2","resolution":{"observed_at":"2026-08-08T19:58:17.671444Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T19:58:17.658247Z","title":"Teams of LLM agents can exploit zero-day vulnerabilities","venue":null,"work_id":"5e9e50e1-40f5-4e53-a093-61fe0c2a9d22","year":2026},"citing_paper":{"arxiv_id":"2608.04317","last_updated":"2026-08-05T00:54:57Z","snapshot_observed_at":"2026-08-09T19:45:40.565565Z","submitted_at":"2026-08-05T00:54:57Z","title":"Trident : How to Break Deep Reinforcement Learning Cyber Defenses (Agentic)","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-08T19:58:17.372961Z"},"links":{"citing_paper":"/paper/2608.04317"},"observation_digest":"sha256:dee113f47aa8e438dab9a1b2cd2951afa3ea66452563e1645c272faef4114d7e","observation_id":"bf259fbf-ae1a-4a4e-8ced-017136dbe910","resolution":{"observed_at":"2026-08-08T19:58:17.661621Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2950.9540","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T19:58:17.469874Z","title":"Cyber-zero: Training cybersecurity agents without runtime","venue":null,"work_id":"a6d3395c-1ef9-40aa-9aa8-99b13a13411c","year":2026},"citing_paper":{"arxiv_id":"2608.04317","last_updated":"2026-08-05T00:54:57Z","snapshot_observed_at":"2026-08-09T19:45:40.565565Z","submitted_at":"2026-08-05T00:54:57Z","title":"Trident : How to Break Deep Reinforcement Learning Cyber Defenses (Agentic)","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-08T19:58:17.376083Z"},"links":{"citing_paper":"/paper/2608.04317"},"observation_digest":"sha256:882eb706e02c990e20ab2da751248e88056d4120eef93cadc920567651fe0a4b","observation_id":"c46cf609-583b-4ba5-b8a1-54ebd9e9fbf7","resolution":{"observed_at":"2026-08-08T19:58:17.476910Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2608.04317","last_updated":"2026-08-05T00:54:57Z","latest_version":1,"primary_category":"cs.CR","snapshot_observed_at":"2026-08-09T19:45:40.565565Z","submitted_at":"2026-08-05T00:54:57Z","title":"Trident : How to Break Deep Reinforcement Learning Cyber Defenses (Agentic)"},"reference_resolution":{"displayed":67,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":29,"verified_exact":0,"verified_fuzzy":37},"total_outbound_references":67},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 67 of 67 outbound references and 0 inbound Pith citation observations for arXiv:2608.04317."}