Pith. sign in

Paper Citation Record · LEDGER

Trident : How to Break Deep Reinforcement Learning Cyber Defenses (Agentic)

As of 9 August 2026, this Paper Citation Record lists 67 of 67 outbound references and 0 inbound Pith citation observations for arXiv:2608.04317.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2608.04317 v1

Coverage vector

measured 67 of 67 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links, observed 2026-08-08T19:58:17.376083Z

measured 67 of 67 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-09T06:31:02.800959+00:00

measured 0 of 0 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: cited_works

Reference resolution

67 of 67 outbound references displayed

  • verified exact0
  • verified fuzzy37
  • unresolved29
  • parse uncertain0
  • malformed identifier1
  • metadata mismatch0

External citation measurements

No source-named external measurement is stored.

Outbound references

Observation e9e9ffb8-750e-4b83-8c2f-bd45f20644c3 · outbound

This paper cites https://www.atomicredteam.io/.

Trident : How to Break Deep Reinforcement Learning Cyber Defenses (Agentic) https://www.atomicredteam.io/

Reference 1

Resolution
verified fuzzy
raw_fallback, observed 2026-08-08T19:58:18.297825Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-08-08T19:58:17.162099Z digest=sha256:b78dae2e3aa1f18fc7167ed5afe9b4bfb76bee3fad0cf042eb71ab2e9c412f3d

Observation 55d89643-12c0-4fe2-b587-e12a11e90d67 · outbound

This paper cites https://aicyberchallenge.com/ overview/.

Trident : How to Break Deep Reinforcement Learning Cyber Defenses (Agentic) https://aicyberchallenge.com/ overview/

Reference 2

Resolution
verified fuzzy
raw_fallback, observed 2026-08-08T19:58:18.288443Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-08-08T19:58:17.166233Z digest=sha256:619b629aa9373faf3469580047b2d256afbd84f1849b1005b23cde716bccc64c

Observation 01e142a8-f26c-45f9-9bbe-4eb79a5a53e1 · outbound

This paper cites https://attack.mitre.org/.

Trident : How to Break Deep Reinforcement Learning Cyber Defenses (Agentic) https://attack.mitre.org/

Reference 3

Resolution
verified fuzzy
raw_fallback, observed 2026-08-08T19:58:18.279178Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-08-08T19:58:17.169561Z digest=sha256:33b31917def13efebad790235a94028d5823c32f4899af354af432453e8a747b

Observation 79f9f41b-f184-4565-abc2-5c6a8e94bdcd · outbound

This paper cites EnIGMA: Interactive tools substantially assist LM agents in finding security vulnerabilities.

Trident : How to Break Deep Reinforcement Learning Cyber Defenses (Agentic) EnIGMA: Interactive tools substantially assist LM agents in finding security vulnerabilities

Reference 4

Resolution
verified fuzzy
raw_fallback, observed 2026-08-08T19:58:18.270066Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-08-08T19:58:17.173238Z digest=sha256:e021ad27d476bf15f3e584567583895325e378a6b32fbde1778fc7ecaef6a928

Observation 067df76b-02b2-4127-a1bc-ba247e54a6f4 · outbound

This paper cites Back to basics: Revisiting REINFORCE-style optimization for learning from human feedback in LLMs.

Trident : How to Break Deep Reinforcement Learning Cyber Defenses (Agentic) Back to basics: Revisiting REINFORCE-style optimization for learning from human feedback in LLMs

Reference 5

Resolution
unresolved
no resolver link, observed 2026-08-08T19:58:17.176790Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-08T19:58:17.176790Z digest=sha256:128d5abaa012dfc6fd80afe35044f462523a10c66a27dcb20815db22bfa4acb5

Observation 141545ae-3ce0-4a1b-9c95-bb69a16af683 · outbound

This paper cites Ctibench: a benchmark for evaluating llms in cyber threat intelligence.

Trident : How to Break Deep Reinforcement Learning Cyber Defenses (Agentic) Ctibench: a benchmark for evaluating llms in cyber threat intelligence

Reference 6

Resolution
verified fuzzy
raw_fallback, observed 2026-08-08T19:58:18.255302Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-08-08T19:58:17.180734Z digest=sha256:8475fcc963dee6a13b580151c27d168a017cce7b6afb39208025be93c9cea47b

Observation 489af948-f565-4c76-9a3a-e2ed8ea9bf0b · outbound

This paper cites Claude Mythos Preview red.anthropic.com — red.anthropic.com.

Trident : How to Break Deep Reinforcement Learning Cyber Defenses (Agentic) Claude Mythos Preview red.anthropic.com — red.anthropic.com

Reference 7

Resolution
verified fuzzy
raw_fallback, observed 2026-08-08T19:58:18.245978Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-08-08T19:58:17.185307Z digest=sha256:19998557e318c9d878a7183dc060771ee6adb80bd767b4b897510d657941a980

Observation a94a278f-1b97-4c27-a052-f8d65eea29d9 · outbound

This paper cites CyberSecEval 2: A Wide-Ranging Cybersecurity Evaluation Suite for Large Language Models.

Trident : How to Break Deep Reinforcement Learning Cyber Defenses (Agentic) CyberSecEval 2: A Wide-Ranging Cybersecurity Evaluation Suite for Large Language Models

Reference 8

Resolution
unresolved
no resolver link, observed 2026-08-08T19:58:17.189295Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-08T19:58:17.189295Z digest=sha256:de9093f66d83ed75c2e4ff1b3ffeda52499bcac9fcd9644eaf6cf7e3739d8323

Observation 7cdc2bd7-d8d6-4bb1-8996-da6ea68649a7 · outbound

This paper cites Purple Llama CyberSecEval: A Secure Coding Benchmark for Language Models.

Trident : How to Break Deep Reinforcement Learning Cyber Defenses (Agentic) Purple Llama CyberSecEval: A Secure Coding Benchmark for Language Models

Reference 9

Resolution
unresolved
no resolver link, observed 2026-08-08T19:58:17.193944Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-08T19:58:17.193944Z digest=sha256:cd70c47d3ff99461f450e87d57db55fb523071fd23c8c1d2f71cc9448ce43c99

Observation 66b4479a-f346-4677-b5e0-5a1b4346697f · outbound

This paper cites Large language models are autonomous cyber defenders.

Trident : How to Break Deep Reinforcement Learning Cyber Defenses (Agentic) Large language models are autonomous cyber defenders

Reference 10

Resolution
verified fuzzy
raw_fallback, observed 2026-08-08T19:58:18.236818Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-08-08T19:58:17.197620Z digest=sha256:29c9be2c243d1283cd282ffdaa1a99c8fcffb0905de9685322187f1b6d4dad79

Observation eafcbef2-bf1a-42ce-8839-962fd2b7ef32 · outbound

This paper cites Agentverse: Facilitating multi-agent collaboration and exploring emergent behaviors.

Trident : How to Break Deep Reinforcement Learning Cyber Defenses (Agentic) Agentverse: Facilitating multi-agent collaboration and exploring emergent behaviors

Reference 11

Resolution
unresolved
no resolver link, observed 2026-08-08T19:58:17.200744Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-08T19:58:17.200744Z digest=sha256:d0397633a142e3304489e6e28c17145cbc7d949b0b6d336fa80023d6082b2499

Observation f56c22bb-c346-46b6-a51d-8999397414a7 · outbound

This paper cites Training Verifiers to Solve Math Word Problems.

Trident : How to Break Deep Reinforcement Learning Cyber Defenses (Agentic) Training Verifiers to Solve Math Word Problems

Reference 12

Resolution
unresolved
no resolver link, observed 2026-08-08T19:58:17.203952Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-08T19:58:17.203952Z digest=sha256:2e4e7524a5b1fd7b968ffd974b27195016327b173e1d5800c87f89f58a0fbb93

Observation c44250ce-64e6-41b6-9e34-c9837de6b25f · outbound

This paper cites PentestGPT: Evaluating and harnessing large language models for automated penetration testing.

Trident : How to Break Deep Reinforcement Learning Cyber Defenses (Agentic) PentestGPT: Evaluating and harnessing large language models for automated penetration testing

Reference 13

Resolution
verified fuzzy
raw_fallback, observed 2026-08-08T19:58:18.222351Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-08-08T19:58:17.207606Z digest=sha256:6556f0b27b26b3f25f6ff80bf58d58dea8a6d9c26bf85ecfdea3c4ad878c8876

Observation 20e8ebcb-43a6-4c2f-9524-793b567730e6 · outbound

This paper cites LLM Agents can Autonomously Exploit One-day Vulnerabilities.

Trident : How to Break Deep Reinforcement Learning Cyber Defenses (Agentic) LLM Agents can Autonomously Exploit One-day Vulnerabilities

Reference 14

Resolution
unresolved
no resolver link, observed 2026-08-08T19:58:17.210586Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-08T19:58:17.210586Z digest=sha256:bf9f2629fdfed8280d05436f37a8e90970982ca5fc227d9c7fedaa44d1253553

Observation 8d7de844-f4f5-43d7-aa20-28fb6659842a · outbound

This paper cites LLM Agents can Autonomously Hack Websites.

Trident : How to Break Deep Reinforcement Learning Cyber Defenses (Agentic) LLM Agents can Autonomously Hack Websites

Reference 15

Resolution
unresolved
no resolver link, observed 2026-08-08T19:58:17.213871Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-08T19:58:17.213871Z digest=sha256:b2c200efd22a0c1311618ad5ef634ef9c573049151d4dbf1268408e1e30971f3

Observation 537a98f3-3e25-4ac9-9f28-20ec16beef8b · outbound

This paper cites Graphplanner: Graph- based agentic routing for LLMs.

Trident : How to Break Deep Reinforcement Learning Cyber Defenses (Agentic) Graphplanner: Graph- based agentic routing for LLMs

Reference 16

Resolution
verified fuzzy
raw_fallback, observed 2026-08-08T19:58:18.213523Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-08-08T19:58:17.217256Z digest=sha256:8f9d7cc604e42ff288b2828b358b0574aaa2ac9922dd0e9fabf75667db9a557b

Observation 8d073036-155f-4786-b95f-11dcadf22c59 · outbound

This paper cites Redcode: Risky code execution and generation benchmark for code agents.

Trident : How to Break Deep Reinforcement Learning Cyber Defenses (Agentic) Redcode: Risky code execution and generation benchmark for code agents

Reference 17

Resolution
verified fuzzy
raw_fallback, observed 2026-08-08T19:58:18.203990Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-08-08T19:58:17.220501Z digest=sha256:65f4671cc67e5e6fdc196893f7ddab88b57cc83640a052921218c367109f1ac5

Observation 39a0136a-f926-47b7-a4fa-5a049b9ef4b5 · outbound

This paper cites DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning.

Trident : How to Break Deep Reinforcement Learning Cyber Defenses (Agentic) DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning

Reference 18

Resolution
unresolved
no resolver link, observed 2026-08-08T19:58:17.223565Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-08T19:58:17.223565Z digest=sha256:079140fda0e89889bbe94177f1258f956a2c7a42eecbf9846c1b73dab832dee6

Observation 392eb2c5-267a-48d7-8cfd-b33f5b60f0b6 · outbound

This paper cites Getting pwn’d by ai: Penetration testing with large language models.

Trident : How to Break Deep Reinforcement Learning Cyber Defenses (Agentic) Getting pwn’d by ai: Penetration testing with large language models

Reference 19

Resolution
verified fuzzy
raw_fallback, observed 2026-08-08T19:58:18.193871Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-08-08T19:58:17.227059Z digest=sha256:72c144487cc5d5d81b030538b3f293f47d20ee744c7f0262e7d3b98ba22aef4f

Observation c775929a-b989-4410-9ac8-1cc62c818250 · outbound

This paper cites Llms as hackers: Autonomous linux privilege escalation attacks.Empirical Software Engineering, 31(3):70, 2026.

Trident : How to Break Deep Reinforcement Learning Cyber Defenses (Agentic) Llms as hackers: Autonomous linux privilege escalation attacks.Empirical Software Engineering, 31(3):70, 2026

Reference 20

Resolution
verified fuzzy
raw_fallback, observed 2026-08-08T19:58:18.183206Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-08-08T19:58:17.230065Z digest=sha256:aef47092ba44fc6c9bb412016059dfe6e4becccf6bf1e77c3fbeb376bf6ad418

Observation a9a08bcc-f95d-4e36-9e3e-b8c4f572151a · outbound

This paper cites Deepmath-103k: A large-scale, challenging, decontaminated, and verifiable mathematical dataset for advancing reasoning.

Trident : How to Break Deep Reinforcement Learning Cyber Defenses (Agentic) Deepmath-103k: A large-scale, challenging, decontaminated, and verifiable mathematical dataset for advancing reasoning

Reference 21

Resolution
verified fuzzy
raw_fallback, observed 2026-08-08T19:58:18.173065Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-08-08T19:58:17.233285Z digest=sha256:148e8f748f132d57206d2b1816fdea2697afed92e16fe6445023dae1ba8ee586

Observation c10c72e4-b6db-44d3-b056-381995d46494 · outbound

This paper cites Qwen2.5-Coder Technical Report.

Trident : How to Break Deep Reinforcement Learning Cyber Defenses (Agentic) Qwen2.5-Coder Technical Report

Reference 22

Resolution
unresolved
no resolver link, observed 2026-08-08T19:58:17.236382Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-08T19:58:17.236382Z digest=sha256:082fcc95240d3e8b990e0b3c037e4c482e6068ae3273a889df7acb1dd70dbcc3

Observation 84a5e156-aac6-4e3a-88ed-2c2efa7cef9b · outbound

This paper cites GPT-4o System Card.

Trident : How to Break Deep Reinforcement Learning Cyber Defenses (Agentic) GPT-4o System Card

Reference 23

Resolution
unresolved
no resolver link, observed 2026-08-08T19:58:17.239797Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-08T19:58:17.239797Z digest=sha256:9d365b9f632924f465caca7ee9cd850bd709b5d9af84387c488198de17e1e5ad

Observation 28054fda-b27f-4aaf-8f4b-81dd9ae96b37 · outbound

This paper cites Agentic ai for cyber defense: Llm-guided hierarchical multi-agent reinforcement learning.

Trident : How to Break Deep Reinforcement Learning Cyber Defenses (Agentic) Agentic ai for cyber defense: Llm-guided hierarchical multi-agent reinforcement learning

Reference 24

Resolution
verified fuzzy
raw_fallback, observed 2026-08-08T19:58:18.160033Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-08-08T19:58:17.243121Z digest=sha256:e3d34a25fafa4fa3e83a7637a099ca68ea82b0240b5683b06f063cd1b010e647

Observation 828afaeb-c042-4d3c-8910-8c58d6057b1c · outbound

This paper cites Search-r1: Training LLMs to reason and leverage search engines with reinforcement learning.

Trident : How to Break Deep Reinforcement Learning Cyber Defenses (Agentic) Search-r1: Training LLMs to reason and leverage search engines with reinforcement learning

Reference 25

Resolution
verified fuzzy
raw_fallback, observed 2026-08-08T19:58:18.148367Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-08-08T19:58:17.246095Z digest=sha256:1af0954db1b6e9cb407c2217543d506d9757b366c21943eba8908546e149ccf3

Observation 5157025d-7461-46e7-b441-5d66539fec3a · outbound

This paper cites Exploring the efficacy of multi-agent reinforcement learning for autonomous cyber defence: A cage challenge 4 perspective.

Trident : How to Break Deep Reinforcement Learning Cyber Defenses (Agentic) Exploring the efficacy of multi-agent reinforcement learning for autonomous cyber defence: A cage challenge 4 perspective

Reference 26

Resolution
unresolved
no resolver link, observed 2026-08-08T19:58:17.249096Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-08T19:58:17.249096Z digest=sha256:ac878ba931b5d6035e1ca4560bd01f2dcf87659a8a3676810814415c9251882d

Observation e6e1b05a-f842-4dbb-b1e7-d144c3b9786f · outbound

This paper cites Automated cyber defense with generalizable graph-based reinforcement learning agents.arXiv preprint arXiv:2509.16151, 2025.

Trident : How to Break Deep Reinforcement Learning Cyber Defenses (Agentic) Automated cyber defense with generalizable graph-based reinforcement learning agents.arXiv preprint arXiv:2509.16151, 2025

Reference 27

Resolution
unresolved
no resolver link, observed 2026-08-08T19:58:17.252347Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-08T19:58:17.252347Z digest=sha256:dd8377f53bd94b8e5240015d095bfd1254cff2e63c7234ad25b040c3dec2c7cf

Observation eea105c7-6006-490e-be8b-80e29d897860 · outbound

This paper cites Large language models are zero-shot reasoners.Advances in neural information processing systems, 35:22199–22213, 2022.

Trident : How to Break Deep Reinforcement Learning Cyber Defenses (Agentic) Large language models are zero-shot reasoners.Advances in neural information processing systems, 35:22199–22213, 2022

Reference 28

Resolution
unresolved
no resolver link, observed 2026-08-08T19:58:17.255777Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-08T19:58:17.255777Z digest=sha256:6e5c0d68570988e7f150f23cc47fe1a689f48c3190e9b504597d39bed874fb79

Observation 002fa239-7cad-40a3-9abc-bd5b8d3cfe68 · outbound

This paper cites Gonzalez, Hao Zhang, and Ion Stoica.

Trident : How to Break Deep Reinforcement Learning Cyber Defenses (Agentic) Gonzalez, Hao Zhang, and Ion Stoica

Reference 29

Resolution
unresolved
no resolver link, observed 2026-08-08T19:58:17.258881Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-08T19:58:17.258881Z digest=sha256:d37ddfde1157e402c8fb64a5ddf142d7bdb7b2e062a81d40ef52f669ab2ffb54

Observation e9181f4b-d3ac-47de-9116-2de7e18ab6a0 · outbound

This paper cites In-the-flow agentic system optimization for effective planning and tool use.

Trident : How to Break Deep Reinforcement Learning Cyber Defenses (Agentic) In-the-flow agentic system optimization for effective planning and tool use

Reference 30

Resolution
verified fuzzy
raw_fallback, observed 2026-08-08T19:58:17.910451Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-08-08T19:58:17.261962Z digest=sha256:15c7405b18c48005a0f6e21900fa41358dd194f95ec2b3ec5883b5c88e1e3c98

Observation 122e0f90-d9be-4245-9c27-eee78120d9bd · outbound

This paper cites Code as policies: Language model programs for embodied control.

Trident : How to Break Deep Reinforcement Learning Cyber Defenses (Agentic) Code as policies: Language model programs for embodied control

Reference 31

Resolution
unresolved
no resolver link, observed 2026-08-08T19:58:17.264984Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-08T19:58:17.264984Z digest=sha256:cb0577239aba64380e9db9a9a41eca9c4d55fba4dbfcde02b1a11f5231e75e30

Observation 74634654-66b4-4099-b9a5-9ac2f6dd52b0 · outbound

This paper cites Et-bert: A contextualized datagram representation with pre-training transformers for encrypted traffic classification.

Trident : How to Break Deep Reinforcement Learning Cyber Defenses (Agentic) Et-bert: A contextualized datagram representation with pre-training transformers for encrypted traffic classification

Reference 32

Resolution
verified fuzzy
raw_fallback, observed 2026-08-08T19:58:17.896149Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-08-08T19:58:17.267969Z digest=sha256:1e34eccf4fed388da930d03557cbca19458c970d1e399e7c84acf05922476306

Observation 602324bb-d5ad-459d-9e75-1357f935d447 · outbound

This paper cites Cyberbench: A multi-task benchmark for evaluating large language models in cybersecurity.

Trident : How to Break Deep Reinforcement Learning Cyber Defenses (Agentic) Cyberbench: A multi-task benchmark for evaluating large language models in cybersecurity

Reference 33

Resolution
verified fuzzy
raw_fallback, observed 2026-08-08T19:58:17.886939Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-08-08T19:58:17.271027Z digest=sha256:85b3e79a93083b3a5fa83d7985246054ae45f846c276a64cafa599950c9aaca7

Observation 7addd55e-ce6c-400f-837c-9d12548168d0 · outbound

This paper cites Visual-rft: Visual reinforcement fine-tuning.

Trident : How to Break Deep Reinforcement Learning Cyber Defenses (Agentic) Visual-rft: Visual reinforcement fine-tuning

Reference 34

Resolution
unresolved
no resolver link, observed 2026-08-08T19:58:17.273922Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-08T19:58:17.273922Z digest=sha256:8b4ae7ecf64a996571ff9c8e549b58f11977c4477d5b09dd4d74b8cbb6e32a5d

Observation fe77814f-b49e-4ca1-a9d0-27a9fc5cc743 · outbound

This paper cites Contrasting centralized and decentralized critics in multi-agent reinforcement learning.

Trident : How to Break Deep Reinforcement Learning Cyber Defenses (Agentic) Contrasting centralized and decentralized critics in multi-agent reinforcement learning

Reference 35

Resolution
verified fuzzy
raw_fallback, observed 2026-08-08T19:58:17.872569Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-08-08T19:58:17.276936Z digest=sha256:eabba2cc90bd714c724ddb1d170bbd74ecfc82e2e0568ec084bd0d698e2d3e6f

Observation 3113a622-7603-43f8-a95c-d5faabd251b3 · outbound

This paper cites Eureka: Human-level reward design via coding large language models.

Trident : How to Break Deep Reinforcement Learning Cyber Defenses (Agentic) Eureka: Human-level reward design via coding large language models

Reference 36

Resolution
unresolved
no resolver link, observed 2026-08-08T19:58:17.279999Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-08T19:58:17.279999Z digest=sha256:4d3174d06cefc55f626495e979acbe25e515d3d06ae16d85f9931f819bef953c

Observation 19bfc18e-0300-400e-9f37-06b0db33acbd · outbound

This paper cites Ray: A distributed framework for emerging {AI} applications.

Trident : How to Break Deep Reinforcement Learning Cyber Defenses (Agentic) Ray: A distributed framework for emerging {AI} applications

Reference 37

Resolution
unresolved
no resolver link, observed 2026-08-08T19:58:17.283080Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-08T19:58:17.283080Z digest=sha256:799e8f2080678d9d2947170e3770a98d58734b27c9d6693a0b45299d07060edc

Observation 3457e4e5-f661-4b23-8580-db69c17dbeaf · outbound

This paper cites Experience with emerald to date.

Trident : How to Break Deep Reinforcement Learning Cyber Defenses (Agentic) Experience with emerald to date

Reference 38

Resolution
verified fuzzy
raw_fallback, observed 2026-08-08T19:58:17.853501Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-08-08T19:58:17.285979Z digest=sha256:7e0ef7fcf89faee3f850ae44c499f9b0d9690b7bf840c4e7111d0d00642f3e70

Observation bbccf353-cf5e-42ab-b437-e87fa106e2e5 · outbound

This paper cites Towards a high fidelity training environment for autonomous cyber defense agents.

Trident : How to Break Deep Reinforcement Learning Cyber Defenses (Agentic) Towards a high fidelity training environment for autonomous cyber defense agents

Reference 39

Resolution
verified fuzzy
raw_fallback, observed 2026-08-08T19:58:17.843871Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-08-08T19:58:17.289324Z digest=sha256:9d9198a40f121936349868faadeaeb93c87ce04a722d4581f774665c7a073c68

Observation 6de97952-a83d-4464-a26e-8cf90eb500df · outbound

This paper cites Proximal Policy Optimization Algorithms.

Trident : How to Break Deep Reinforcement Learning Cyber Defenses (Agentic) Proximal Policy Optimization Algorithms

Reference 40

Resolution
unresolved
no resolver link, observed 2026-08-08T19:58:17.292586Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-08T19:58:17.292586Z digest=sha256:e01e8da2727669385011860f5949289d7b33ded37b43589fdf98dc07022c3850

Observation a004ecfb-09e6-44c3-986f-43b6cbf9ea81 · outbound

This paper cites Nyu ctf bench: A scalable open-source benchmark dataset for evaluating llms in offensive security.

Trident : How to Break Deep Reinforcement Learning Cyber Defenses (Agentic) Nyu ctf bench: A scalable open-source benchmark dataset for evaluating llms in offensive security

Reference 41

Resolution
verified fuzzy
raw_fallback, observed 2026-08-08T19:58:17.834168Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-08-08T19:58:17.295843Z digest=sha256:6fd0a6379ba26a9cad4603f1d99ba22542bd6879d4eb99ddfa677777ceb79f83

Observation 3a10cc6c-cbfd-46c2-a99b-629db9076462 · outbound

This paper cites DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models.

Trident : How to Break Deep Reinforcement Learning Cyber Defenses (Agentic) DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models

Reference 42

Resolution
unresolved
no resolver link, observed 2026-08-08T19:58:17.298765Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-08T19:58:17.298765Z digest=sha256:497faed3af998adee0fc9f84dfcd21e72adcf1b825833088fffd3800a7129551

Observation 97c601a8-7810-4d7f-93d1-c46ca867f66b · outbound

This paper cites Hybridflow: A flexible and efficient rlhf framework.

Trident : How to Break Deep Reinforcement Learning Cyber Defenses (Agentic) Hybridflow: A flexible and efficient rlhf framework

Reference 43

Resolution
unresolved
no resolver link, observed 2026-08-08T19:58:17.301997Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-08T19:58:17.301997Z digest=sha256:42dcbb0aab0ad820af92318079e1f8edb514dbd62aaa586e88bf9837cbf7cbc1

Observation b6fbeb53-181b-4e61-9d1c-dbe37dd0d1ce · outbound

This paper cites Hierarchical multi-agent reinforcement learning for cyber network defense.Reinforcement Learning Journal, 6:790–810, 2025.

Trident : How to Break Deep Reinforcement Learning Cyber Defenses (Agentic) Hierarchical multi-agent reinforcement learning for cyber network defense.Reinforcement Learning Journal, 6:790–810, 2025

Reference 44

Resolution
verified fuzzy
raw_fallback, observed 2026-08-08T19:58:17.819801Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-08-08T19:58:17.305358Z digest=sha256:f93d169d77bb4750c06ed1242b49b7d2eac7535c14332983bda56dcc6fbb7649

Observation 0d1bded1-97d5-40eb-8495-315f36c22d2b · outbound

This paper cites A taxonomy of intrusion response systems.

Trident : How to Break Deep Reinforcement Learning Cyber Defenses (Agentic) A taxonomy of intrusion response systems

Reference 45

Resolution
verified fuzzy
raw_fallback, observed 2026-08-08T19:58:17.810253Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-08-08T19:58:17.308716Z digest=sha256:a018ea579b2a09584beac50555088b7e3eb05fac38b3e708110d13d0886802d8

Observation 2f99b4cb-176e-44b6-8d9e-9af9daa5eac8 · outbound

This paper cites Redsage: A cybersecurity generalist LLM.

Trident : How to Break Deep Reinforcement Learning Cyber Defenses (Agentic) Redsage: A cybersecurity generalist LLM

Reference 46

Resolution
verified fuzzy
raw_fallback, observed 2026-08-08T19:58:17.800806Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-08-08T19:58:17.311692Z digest=sha256:59eb91f955db9c3e5d85cbea55509a2636db7678f5d3eef8cd9570aec58487f0

Observation 294053bb-943e-470b-9ada-fd18ddb5bad4 · outbound

This paper cites Cyberbattlesim, 2021.

Trident : How to Break Deep Reinforcement Learning Cyber Defenses (Agentic) Cyberbattlesim, 2021

Reference 47

Resolution
verified fuzzy
raw_fallback, observed 2026-08-08T19:58:17.791420Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-08-08T19:58:17.314759Z digest=sha256:6a2715418b151683b719d36e7b1d23976240af57ebf02abe453d4f6d2c210df6

Observation 1782e2f7-4dd3-4e2a-9cab-129cb7519f89 · outbound

This paper cites Qwen2.5: A party of foundation models, September 2024.

Trident : How to Break Deep Reinforcement Learning Cyber Defenses (Agentic) Qwen2.5: A party of foundation models, September 2024

Reference 48

Resolution
unresolved
no resolver link, observed 2026-08-08T19:58:17.317755Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-08T19:58:17.317755Z digest=sha256:14a09c9f70424aefeb1ec47df7a2db7dfd91e4be3ab58b38135c4f3b28c2d711

Observation 52f80ab4-0d91-46e9-be5e-44d05215a9f5 · outbound

This paper cites CYBERSECEVAL 3: Advancing the Evaluation of Cybersecurity Risks and Capabilities in Large Language Models.

Trident : How to Break Deep Reinforcement Learning Cyber Defenses (Agentic) CYBERSECEVAL 3: Advancing the Evaluation of Cybersecurity Risks and Capabilities in Large Language Models

Reference 49

Resolution
unresolved
no resolver link, observed 2026-08-08T19:58:17.320654Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-08T19:58:17.320654Z digest=sha256:4428df512aae005077220f13b99f93587173e918317fdbcdf3a1d1b2a012cdf9

Observation c66d7f38-f65f-4667-bcd0-2e9622ff5b4e · outbound

This paper cites SPPO: Sequence-Level PPO for Long-Horizon Reasoning Tasks.

Trident : How to Break Deep Reinforcement Learning Cyber Defenses (Agentic) SPPO: Sequence-Level PPO for Long-Horizon Reasoning Tasks

Reference 50

Resolution
unresolved
no resolver link, observed 2026-08-08T19:58:17.324049Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-08T19:58:17.324049Z digest=sha256:358bb1bd868f4b15049c4e1a17f60171200a1da8a1926fd5c0a79af6f816ec95

Observation 2c23d796-9356-45ec-a517-60c7e6bfa970 · outbound

This paper cites SymRTLO: Enhancing RTL code optimization with LLMs and neuron-inspired symbolic reasoning.

Trident : How to Break Deep Reinforcement Learning Cyber Defenses (Agentic) SymRTLO: Enhancing RTL code optimization with LLMs and neuron-inspired symbolic reasoning

Reference 51

Resolution
verified fuzzy
raw_fallback, observed 2026-08-08T19:58:17.776191Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-08-08T19:58:17.327331Z digest=sha256:1830454be320dcc2329a5eb86544e752882a63750c7af3ce785a6d71e95b1b5e

Observation 5dfeadbe-4bab-4196-a7e0-b38991215f8c · outbound

This paper cites Cyber- gym: Evaluating AI agents’ real-world cybersecurity capabilities at scale.

Trident : How to Break Deep Reinforcement Learning Cyber Defenses (Agentic) Cyber- gym: Evaluating AI agents’ real-world cybersecurity capabilities at scale

Reference 52

Resolution
unresolved
no resolver link, observed 2026-08-08T19:58:17.330596Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-08T19:58:17.330596Z digest=sha256:6754e07e7a7bffab4daaec3753e350bab1649e0fc3a71b921a16b625e2072bae

Observation 7d765deb-4598-47d6-9abe-0b9c9fe38835 · outbound

This paper cites SWE-RL: Advancing LLM reasoning via reinforcement learning on open software evolution.

Trident : How to Break Deep Reinforcement Learning Cyber Defenses (Agentic) SWE-RL: Advancing LLM reasoning via reinforcement learning on open software evolution

Reference 53

Resolution
verified fuzzy
raw_fallback, observed 2026-08-08T19:58:17.762294Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-08-08T19:58:17.333659Z digest=sha256:37fdee0609d79fc7c2ca979a48642346a199b3383619e9dde2e3fdb1abbfb25c

Observation 7967ed37-304e-4d30-8fef-a0d5f8595db7 · outbound

This paper cites Autogen: Enabling next-gen LLM applications via multi-agent conversations.

Trident : How to Break Deep Reinforcement Learning Cyber Defenses (Agentic) Autogen: Enabling next-gen LLM applications via multi-agent conversations

Reference 54

Resolution
verified fuzzy
raw_fallback, observed 2026-08-08T19:58:17.752947Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-08-08T19:58:17.336740Z digest=sha256:14a5c8628735854ed3b9b1900e8835362c34eefee38ebc64e371094e57a8333c

Observation eee7a847-1c5c-464e-8a27-af119d650e66 · outbound

This paper cites Qwen2 Technical Report.

Trident : How to Break Deep Reinforcement Learning Cyber Defenses (Agentic) Qwen2 Technical Report

Reference 55

Resolution
unresolved
no resolver link, observed 2026-08-08T19:58:17.339747Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-08T19:58:17.339747Z digest=sha256:4ea79ed6dd730f5d0d9458718400d8bf3d0d2be4da9ee6f9b37ff826828e3b0e

Observation c3698d0f-5488-44a5-81a1-c9642f22a97c · outbound

This paper cites Intercode: Standardizing and benchmarking interactive coding with execution feedback.Advances in Neural Information Processing Systems, 36:23826–23854, 2023.

Trident : How to Break Deep Reinforcement Learning Cyber Defenses (Agentic) Intercode: Standardizing and benchmarking interactive coding with execution feedback.Advances in Neural Information Processing Systems, 36:23826–23854, 2023

Reference 56

Resolution
unresolved
no resolver link, observed 2026-08-08T19:58:17.343099Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-08T19:58:17.343099Z digest=sha256:d9cddbd42712595c13c30b442bcaa7ac4fc8cb153aae09928a3e225f2b30ee01

Observation f1dc883e-3319-46a9-bdee-54080f81ded9 · outbound

This paper cites React: Synergizing reasoning and acting in language models.

Trident : How to Break Deep Reinforcement Learning Cyber Defenses (Agentic) React: Synergizing reasoning and acting in language models

Reference 57

Resolution
unresolved
no resolver link, observed 2026-08-08T19:58:17.346037Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-08T19:58:17.346037Z digest=sha256:d981ddc51e1bc47d2d7685b79bcbb770ec73533e749dab269b6eb3a731c17e7d

Observation 1e522d46-fdde-43c2-bcf0-37c6e7d88933 · outbound

This paper cites Primus: A pioneering collection of open-source datasets for cybersecurity LLM training.

Trident : How to Break Deep Reinforcement Learning Cyber Defenses (Agentic) Primus: A pioneering collection of open-source datasets for cybersecurity LLM training

Reference 58

Resolution
verified fuzzy
raw_fallback, observed 2026-08-08T19:58:17.734052Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-08-08T19:58:17.348903Z digest=sha256:6bc1792715c30f12538edc950de319ae9c52731536bc410cd577cd8f54b7be9a

Observation 1caec6f9-8983-4b60-8d5d-737a854fc042 · outbound

This paper cites ACECODER: Acing coder RL via automated test-case synthesis.

Trident : How to Break Deep Reinforcement Learning Cyber Defenses (Agentic) ACECODER: Acing coder RL via automated test-case synthesis

Reference 59

Resolution
verified fuzzy
raw_fallback, observed 2026-08-08T19:58:17.724919Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-08-08T19:58:17.351778Z digest=sha256:b2f7d715fa2db5d63ecd8a9edfd24c4af5949c2281598ba8d5cb69dbd10ce5db

Observation 367b9b5e-445a-46ef-b1b6-e52272cd4fa2 · outbound

This paper cites Ho, and Percy Liang.

Trident : How to Break Deep Reinforcement Learning Cyber Defenses (Agentic) Ho, and Percy Liang

Reference 60

Resolution
unresolved
no resolver link, observed 2026-08-08T19:58:17.354780Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-08T19:58:17.354780Z digest=sha256:c5317a51da3775de554c59f9fb50eebc73a3fe799b9c0eaadc4f899d507c0e9d

Observation 13fc7108-c6b0-42d2-9814-7d4992243321 · outbound

This paper cites Abdi, William Blum, and Muhammad Abdul-Mageed.

Trident : How to Break Deep Reinforcement Learning Cyber Defenses (Agentic) Abdi, William Blum, and Muhammad Abdul-Mageed

Reference 61

Resolution
verified fuzzy
raw_fallback, observed 2026-08-08T19:58:17.710547Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-08-08T19:58:17.357824Z digest=sha256:a8f10b04733b631b9c4fac27fcc4188460c9b44e0a891df096e746f7629581b0

Observation e13e38df-282a-43f7-a6e7-425f58fe3047 · outbound

This paper cites Yet another traffic classifier: A masked autoencoder based traffic transformer with multi- level flow representation.

Trident : How to Break Deep Reinforcement Learning Cyber Defenses (Agentic) Yet another traffic classifier: A masked autoencoder based traffic transformer with multi- level flow representation

Reference 62

Resolution
verified fuzzy
raw_fallback, observed 2026-08-08T19:58:17.700836Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-08-08T19:58:17.360906Z digest=sha256:55d8aa8f3435b1e14f5234eb82f8bcf5a4e79d242c32f0ae7e1779dd9675c2cd

Observation 0ad2c876-7da4-447a-9c50-02f548644f98 · outbound

This paper cites Curran Associates Inc., Red Hook, NY , USA, 2019.

Trident : How to Break Deep Reinforcement Learning Cyber Defenses (Agentic) Curran Associates Inc., Red Hook, NY , USA, 2019

Reference 63

Resolution
verified fuzzy
raw_fallback, observed 2026-08-08T19:58:17.690889Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-08-08T19:58:17.363877Z digest=sha256:5f349284342bbed9bd12390b72d2297e105a2bd43708267f82a584d6daf86648

Observation 7c3dd15d-4a6b-4b36-974e-70e9254d75d6 · outbound

This paper cites More than just functional: LLM-as-a-critique for efficient code generation.

Trident : How to Break Deep Reinforcement Learning Cyber Defenses (Agentic) More than just functional: LLM-as-a-critique for efficient code generation

Reference 64

Resolution
verified fuzzy
raw_fallback, observed 2026-08-08T19:58:17.681374Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-08-08T19:58:17.366857Z digest=sha256:f8c2ab7da72c5177f159032c3a4d1b9273f4b719a194f1957feadbb13c1f9c8a

Observation 9750a2ff-fd21-4e2c-8c61-455322623ec2 · outbound

This paper cites CVE-bench: A benchmark for AI agents’ ability to exploit real-world web application vulnerabilities.

Trident : How to Break Deep Reinforcement Learning Cyber Defenses (Agentic) CVE-bench: A benchmark for AI agents’ ability to exploit real-world web application vulnerabilities

Reference 65

Resolution
verified fuzzy
raw_fallback, observed 2026-08-08T19:58:17.671444Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-08-08T19:58:17.369963Z digest=sha256:6545ed1515b5e4965abf8ea4b90dcc305338485f11ab057338648d617a649492

Observation bf259fbf-ae1a-4a4e-8ced-017136dbe910 · outbound

This paper cites Teams of LLM agents can exploit zero-day vulnerabilities.

Trident : How to Break Deep Reinforcement Learning Cyber Defenses (Agentic) Teams of LLM agents can exploit zero-day vulnerabilities

Reference 66

Resolution
verified fuzzy
raw_fallback, observed 2026-08-08T19:58:17.661621Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-08-08T19:58:17.372961Z digest=sha256:9e431774c0af56d40140d082aaa00f2d9e66276046caf0f22ecd86c411ad7794

Observation c46cf609-583b-4ba5-b8a1-54ebd9e9fbf7 · outbound

This paper cites Cyber-zero: Training cybersecurity agents without runtime.

Trident : How to Break Deep Reinforcement Learning Cyber Defenses (Agentic) Cyber-zero: Training cybersecurity agents without runtime

Reference 67

Resolution
malformed identifier
raw_fallback, observed 2026-08-08T19:58:17.476910Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-08-08T19:58:17.376083Z digest=sha256:9c905b018a08afd402b0edf9ded0189fd7fea0898247a275aa86c3e216915eb1

Pith citing papers

No inbound Pith citation observations are available.