Pith. sign in

Paper Citation Record · LEDGER

Systematic Capability Benchmarking of Frontier Large Language Models for Offensive Cyber Tasks

As of 14 August 2026, this Paper Citation Record lists 12 of 12 outbound references and 0 inbound Pith citation observations for arXiv:2604.17159.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2604.17159 v1

Coverage vector

measured 12 of 12 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links, observed 2026-05-10T06:02:32.399075Z

measured 12 of 12 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-14T06:32:32.682623+00:00

measured 0 of 0 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: cited_works

Reference resolution

12 of 12 outbound references displayed

  • verified exact5
  • verified fuzzy3
  • unresolved0
  • parse uncertain0
  • malformed identifier0
  • metadata mismatch4

External citation measurements

No source-named external measurement is stored.

Outbound references

Observation 8927117d-cc4c-4fb4-88ca-d6e6cba95f30 · outbound

This paper cites Generative AI in cybersecurity: A com- prehensive review of LLM applications and vulnerabilities.

Systematic Capability Benchmarking of Frontier Large Language Models for Offensive Cyber Tasks Generative AI in cybersecurity: A com- prehensive review of LLM applications and vulnerabilities

Reference 1

Resolution
verified fuzzy
raw_fallback, observed 2026-05-21T18:05:27.878652Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=pdf_text observed=2026-05-10T06:02:32.399075Z digest=sha256:257aa1482576cf4e47b5ffc0f17f71db4dda89a104aa16982a944341a174ad5e

Observation 479d3493-16c0-438e-8fbb-2b1b43ddccdd · outbound

This paper cites LLM Agents can Autonomously Hack Websites.

Systematic Capability Benchmarking of Frontier Large Language Models for Offensive Cyber Tasks LLM Agents can Autonomously Hack Websites

Reference 2

Resolution
metadata mismatch
arxiv_id, observed 2026-05-10T06:06:19.079644Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=pdf_text observed=2026-05-10T06:02:32.399075Z digest=sha256:e4dcb6bbd2f192e1896eb971177ee8ce9caafd44ca2e0c113c7d6726b615454e

Observation 77506b14-1d7b-41c9-ab74-0a552213cd1e · outbound

This paper cites PentestGPT: Evaluating and harnessing large language models for automated penetration testing.

Systematic Capability Benchmarking of Frontier Large Language Models for Offensive Cyber Tasks PentestGPT: Evaluating and harnessing large language models for automated penetration testing

Reference 3

Resolution
verified fuzzy
raw_fallback, observed 2026-05-21T18:05:27.880650Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=pdf_text observed=2026-05-10T06:02:32.399075Z digest=sha256:627cc544c15b8ff4cfb5e503de3cdf5d397a5d3a314009574a30c172e2f718c7

Observation f1e731c9-9870-46d5-a69c-b3b9c6ce0b86 · outbound

This paper cites OCCULT: Evaluating Large Language Models for Offensive Cyber Operation Capabilities.

Systematic Capability Benchmarking of Frontier Large Language Models for Offensive Cyber Tasks OCCULT: Evaluating Large Language Models for Offensive Cyber Operation Capabilities

Reference 4

Resolution
verified exact
arxiv_id, observed 2026-05-10T06:06:19.095389Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=pdf_text observed=2026-05-10T06:02:32.399075Z digest=sha256:e574cefbea7a55374e96ef98c6e0f790cb3f7b2ea6d9849926be198bdd8fb9b3

Observation 465b323a-806e-4e04-8059-d42cec2a3e14 · outbound

This paper cites NYU CTF Bench: A Scalable Open-Source Benchmark Dataset for Evaluating LLMs in Offensive Security.

Systematic Capability Benchmarking of Frontier Large Language Models for Offensive Cyber Tasks NYU CTF Bench: A Scalable Open-Source Benchmark Dataset for Evaluating LLMs in Offensive Security

Reference 5

Resolution
verified exact
arxiv_id, observed 2026-05-10T06:06:19.098028Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=pdf_text observed=2026-05-10T06:02:32.399075Z digest=sha256:d20d9b39e5c829b97d6b3236dcdab8457af62ea676d78639ca9d8974def6eb9e

Observation 7613c64e-2c0d-4576-8aea-5fcbcae9637c · outbound

This paper cites EnIGMA: Interactive Tools Substantially Assist LM Agents in Finding Security Vulnerabilities.

Systematic Capability Benchmarking of Frontier Large Language Models for Offensive Cyber Tasks EnIGMA: Interactive Tools Substantially Assist LM Agents in Finding Security Vulnerabilities

Reference 6

Resolution
metadata mismatch
arxiv_id, observed 2026-05-10T06:06:19.085010Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=pdf_text observed=2026-05-10T06:02:32.399075Z digest=sha256:b0c8f8ddcbaf54ffa42ac5e156c01268f490036ee5e7b1ab893cc338811b7343

Observation ec0a22bb-13f5-4249-81da-1e0d1341dad6 · outbound

This paper cites D-CIPHER: Dynamic Collaborative Intelligent Multi-Agent System with Planner and Heterogeneous Executors for Offensive Security.

Systematic Capability Benchmarking of Frontier Large Language Models for Offensive Cyber Tasks D-CIPHER: Dynamic Collaborative Intelligent Multi-Agent System with Planner and Heterogeneous Executors for Offensive Security

Reference 7

Resolution
verified exact
arxiv_id, observed 2026-05-10T06:06:19.082441Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=pdf_text observed=2026-05-10T06:02:32.399075Z digest=sha256:e98a64f2b0bff3ee369596176b5e367795ad44f347d08c08b1d16c7cc2b4ca75

Observation a1693e07-42de-44bf-889c-eaf38d71ce4b · outbound

This paper cites CRAKEN: Cybersecurity LLM Agent with Knowledge-Based Execution.

Systematic Capability Benchmarking of Frontier Large Language Models for Offensive Cyber Tasks CRAKEN: Cybersecurity LLM Agent with Knowledge-Based Execution

Reference 8

Resolution
verified exact
arxiv_id, observed 2026-05-10T06:06:19.089932Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=pdf_text observed=2026-05-10T06:02:32.399075Z digest=sha256:a67a80b316d3d6280cf99ac80f23d7adfdeb7279cb340bd65e00e109c363bdb8

Observation 4bb081e1-779b-4042-a3d7-129c3a192a6f · outbound

This paper cites An Empirical Evaluation of LLMs for Solving Offensive Security Challenges.

Systematic Capability Benchmarking of Frontier Large Language Models for Offensive Cyber Tasks An Empirical Evaluation of LLMs for Solving Offensive Security Challenges

Reference 9

Resolution
verified exact
arxiv_id, observed 2026-05-10T06:06:19.100715Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=pdf_text observed=2026-05-10T06:02:32.399075Z digest=sha256:2ed09344af205f083c9a26e12e13c84a4f745571cb1735ce6192846ffdbc5347

Observation 670e3a77-f49b-4e6a-b904-6acda6aaf242 · outbound

This paper cites Cybench: A Framework for Evaluating Cybersecurity Capabilities and Risks of Language Models.

Systematic Capability Benchmarking of Frontier Large Language Models for Offensive Cyber Tasks Cybench: A Framework for Evaluating Cybersecurity Capabilities and Risks of Language Models

Reference 10

Resolution
metadata mismatch
arxiv_id, observed 2026-05-10T06:06:19.087529Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=pdf_text observed=2026-05-10T06:02:32.399075Z digest=sha256:d3e63af308162659eea5110f71c4b5184c7a6edcfd6195586baa8ba99d04ac09

Observation f925fd48-69c5-4323-a651-8aae7f8b7b15 · outbound

This paper cites CTFusion: A CTF-based benchmark for LLM agent evaluation.

Systematic Capability Benchmarking of Frontier Large Language Models for Offensive Cyber Tasks CTFusion: A CTF-based benchmark for LLM agent evaluation

Reference 11

Resolution
verified fuzzy
raw_fallback, observed 2026-05-21T18:05:27.883199Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=pdf_text observed=2026-05-10T06:02:32.399075Z digest=sha256:7402a24e0f09a12f3fc5d7850955cccd119fbcb526443075d764b30eb8b99055

Observation 4342aafa-f030-4bd0-9318-cb02d203a8f3 · outbound

This paper cites Zhang, Joey Ji, Celeste Menders, Riya Dulepet, T.

Systematic Capability Benchmarking of Frontier Large Language Models for Offensive Cyber Tasks Zhang, Joey Ji, Celeste Menders, Riya Dulepet, T

Reference 12

Resolution
metadata mismatch
arxiv_id, observed 2026-05-10T06:06:19.092403Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=pdf_text observed=2026-05-10T06:02:32.399075Z digest=sha256:14ac90b863dc8cabcafdea60e7863649e76375e06cd2c193296f2214a5f32803

Pith citing papers

No inbound Pith citation observations are available.