Pith. sign in

Paper Citation Record · LEDGER

SWE-Bench+: Enhanced Coding Benchmark for LLMs

As of 14 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 41 inbound Pith citation observations for arXiv:2410.06992.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2410.06992 v2

Coverage vector

measured 0 of 0 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links

measured 41 of 41 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-14T06:32:32.682623+00:00

measured 41 of 41 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links, observed 2026-08-14T04:39:14.638892Z

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: pith, observed 2026-07-09T06:06:01.699658Z

Reference resolution

0 of 0 outbound references displayed

  • verified exact0
  • verified fuzzy0
  • unresolved0
  • parse uncertain0
  • malformed identifier0
  • metadata mismatch0

External citation measurements

No source-named external measurement is stored.

Outbound references

No outbound reference observations are available for this paper version.

Pith citing papers

Observation 734c1bc4-4623-40cb-aa05-49b7d4d376e7 · inbound

Are Large Language Models Memorizing Bug Benchmarks? cites this paper.

Are Large Language Models Memorizing Bug Benchmarks? SWE-Bench+: Enhanced Coding Benchmark for LLMs

Reference 15

Resolution
unresolved
no resolver link, observed 2026-08-12T16:38:42.349704Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-12T16:38:42.349704Z digest=sha256:7e843dc75fd23b7c99d40580270dc0b5528cdb656333eea4c2a20892126bc51b

Observation b0720d43-ead2-4c3b-8ad8-dc7370652551 · inbound

TDD-Bench Verified: Can LLMs Generate Tests for Issues Before They Get Resolved? cites this paper.

TDD-Bench Verified: Can LLMs Generate Tests for Issues Before They Get Resolved? SWE-Bench+: Enhanced Coding Benchmark for LLMs

Reference 35

Resolution
unresolved
no resolver link, observed 2026-08-11T23:02:34.174469Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T23:02:34.174469Z digest=sha256:f848908b9ce8d42c3fa077efd64d179004add2e589e867eed0192895e07f002d

Observation 33aeee14-9ed4-4008-ba10-896630427d4f · inbound

Empirical Research on Utilizing LLM-based Agents for Automated Bug Fixing via LangGraph cites this paper.

Empirical Research on Utilizing LLM-based Agents for Automated Bug Fixing via LangGraph SWE-Bench+: Enhanced Coding Benchmark for LLMs

Reference 2

Resolution
unresolved
no resolver link, observed 2026-08-10T04:37:16.653625Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-10T04:37:16.653625Z digest=sha256:7eaa19136ce14c3943ae71f96ba7c97c599299a477e5a94baca994820030cb70

Observation d6fd010e-2f4e-401d-ae27-e2b6d8badf8d · inbound

Survey on Evaluation of LLM-based Agents cites this paper.

Survey on Evaluation of LLM-based Agents SWE-Bench+: Enhanced Coding Benchmark for LLMs

Reference 1

Resolution
verified exact
arxiv_id, observed 2026-05-22T22:55:12.249970Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=pdf_text observed=2026-05-22T22:53:21.789769Z digest=sha256:e10bb1851b5702bc1517a66255575d2f2b821b470493ac9b7caebe758005b505

Observation 03c1fc2a-f737-4294-88ae-31b39d749740 · inbound

AI Scientists Fail Without Strong Implementation Capability cites this paper.

AI Scientists Fail Without Strong Implementation Capability SWE-Bench+: Enhanced Coding Benchmark for LLMs

Reference 2025

Resolution
unresolved
no resolver link, observed 2026-08-07T11:49:00.759281Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T11:49:00.759281Z digest=sha256:dbc25ba6a93ce883251b5f2cb49fea3d0a48e602c8fef660339e9a3e4e38e143

Observation 28f50129-f104-4548-8edb-974f1bb26935 · inbound

UTBoost: Rigorous Evaluation of Coding Agents on SWE-Bench cites this paper.

UTBoost: Rigorous Evaluation of Coding Agents on SWE-Bench SWE-Bench+: Enhanced Coding Benchmark for LLMs

Reference 2024

Resolution
unresolved
no resolver link, observed 2026-08-07T04:57:01.065245Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T04:57:01.065245Z digest=sha256:8b3872e24389261db97c50fe66f3c343666aa728a737b47dd390ae2bde684ef6

Observation 813acb66-9098-400d-ad9c-6e5b2a189a9b · inbound

Evolutionary Perspectives on the Evaluation of LLM-Based AI Agents: A Comprehensive Survey cites this paper.

Evolutionary Perspectives on the Evaluation of LLM-Based AI Agents: A Comprehensive Survey SWE-Bench+: Enhanced Coding Benchmark for LLMs

Reference 27

Resolution
unresolved
no resolver link, observed 2026-08-07T06:00:17.909889Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T06:00:17.909889Z digest=sha256:63ad7db661700c9c80ebbf60b4fd37fe042d49869278389e24db1fed93f20e93

Observation d597f088-f028-4633-961e-c630e8acdb65 · inbound

SWE-MERA: A Dynamic Benchmark for Agenticly Evaluating Large Language Models on Software Engineering Tasks cites this paper.

SWE-MERA: A Dynamic Benchmark for Agenticly Evaluating Large Language Models on Software Engineering Tasks SWE-Bench+: Enhanced Coding Benchmark for LLMs

Reference 3

Resolution
unresolved
no resolver link, observed 2026-08-06T17:23:31.742334Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-06T17:23:31.742334Z digest=sha256:ae9a580db9e60d2277ccffa62a6a40411f7d9637041b6061fc103e963c5753a3

Observation 5fe3e2bd-be30-4584-8c04-edcb7807487d · inbound

A Survey of Self-Evolving Agents: What, When, How, and Where to Evolve on the Path to Artificial Super Intelligence cites this paper.

A Survey of Self-Evolving Agents: What, When, How, and Where to Evolve on the Path to Artificial Super Intelligence SWE-Bench+: Enhanced Coding Benchmark for LLMs

Reference 108

Resolution
verified exact
arxiv_id, observed 2026-05-14T22:23:15.793324Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=arxiv_source observed=2026-05-14T22:23:14.621091Z digest=sha256:ebcd3fa875af516509e1c16004045df8a061036001870fe2d7c5cb9223a26a8e

Observation 1c4d3d22-d861-4f52-a7f0-60a2169c301b · inbound

What You See Is What It Does: A Structural Pattern for Legible Software cites this paper.

What You See Is What It Does: A Structural Pattern for Legible Software SWE-Bench+: Enhanced Coding Benchmark for LLMs

Reference 2

Resolution
unresolved
no resolver link, observed 2026-08-05T18:33:01.591675Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T18:33:01.591675Z digest=sha256:e01733eed4e22781604d4a375dbf72a4865ca9927c114011324a85a469a85b1a

Observation c44fd470-a130-4890-8f22-92769b81ba68 · inbound

Agentic Software Engineering: Foundational Pillars and a Research Roadmap cites this paper.

Agentic Software Engineering: Foundational Pillars and a Research Roadmap SWE-Bench+: Enhanced Coding Benchmark for LLMs

Reference 1

Resolution
unresolved
no resolver link, observed 2026-08-04T23:57:05.740344Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T23:57:05.740344Z digest=sha256:39f7bd2bc8a8e9950894560935c7c8d37ee49746ed91a56bdd4b69a9cbd61b27

Observation b58572c5-3108-493a-9244-811664d4d9a7 · inbound

SWE-Bench Pro: Can AI Agents Solve Long-Horizon Software Engineering Tasks? cites this paper.

SWE-Bench Pro: Can AI Agents Solve Long-Horizon Software Engineering Tasks? SWE-Bench+: Enhanced Coding Benchmark for LLMs

Reference 1

Resolution
verified exact
arxiv_id, observed 2026-05-12T13:48:53.720917Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=pdf_text observed=2026-05-12T13:48:53.691192Z digest=sha256:6a22d4011ec5c052149df0aab8fa9a33d5d5d271bef2cdc674001cb80cad7d02

Observation 3d751a8e-f0a8-45e3-9085-a24626676f65 · inbound

Estimating the Empowerment of Language Model Agents cites this paper.

Estimating the Empowerment of Language Model Agents SWE-Bench+: Enhanced Coding Benchmark for LLMs

Reference 4

Resolution
unresolved
no resolver link, observed 2026-08-04T14:53:14.713072Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-04T14:53:14.713072Z digest=sha256:ba62f3422e5f653d7de6d4db94e75022be11876a373d90f143d704eaff4ed54f

Observation 4e515c7b-4519-4917-a171-49dd09df8e32 · inbound

A Retrieval-Augmented Generation Approach to Extracting Algorithmic Logic from Neural Networks cites this paper.

A Retrieval-Augmented Generation Approach to Extracting Algorithmic Logic from Neural Networks SWE-Bench+: Enhanced Coding Benchmark for LLMs

Reference 17

Resolution
metadata mismatch
arxiv_id, observed 2026-05-21T17:54:18.588382Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=pdf_text observed=2026-05-21T17:51:20.393473Z digest=sha256:45a223ebdea8b9ee0c3dc703ff9861dcffc5b363fb76d886f8ed0b9dc06f297a

Observation dd23f142-01f3-45c8-b6ae-3612b4efa103 · inbound

AgentCE-Bench: Agent Configurable Evaluation with Scalable Horizons and Controllable Difficulty under Lightweight Environments cites this paper.

AgentCE-Bench: Agent Configurable Evaluation with Scalable Horizons and Controllable Difficulty under Lightweight Environments SWE-Bench+: Enhanced Coding Benchmark for LLMs

Reference 2

Resolution
verified exact
arxiv_id, observed 2026-05-10T23:30:49.340961Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=pdf_text observed=2026-05-10T19:07:46.077831Z digest=sha256:554e16006b8f98f786cb7f0d2b8953c38c6f6afbdb1fd255da08630ed6cd545a

Observation 78123d6e-1e37-40cf-883e-f4213a472ff7 · inbound

REAgent: Requirement-Driven LLM Agents for Software Issue Resolution cites this paper.

REAgent: Requirement-Driven LLM Agents for Software Issue Resolution SWE-Bench+: Enhanced Coding Benchmark for LLMs

Reference 1

Resolution
verified exact
arxiv_id, observed 2026-05-11T05:51:00.253944Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=pdf_text observed=2026-05-10T17:56:32.201591Z digest=sha256:fd7e3e04811e3663716c367a59d772c93d14563ee2233604f6718288784ed673

Observation 9d788d73-1faf-4d00-a682-5796b9fbe2a3 · inbound

CityRAG: Stepping Into a City via Spatially-Grounded Video Generation cites this paper.

CityRAG: Stepping Into a City via Spatially-Grounded Video Generation SWE-Bench+: Enhanced Coding Benchmark for LLMs

Reference 2

Resolution
verified exact
arxiv_id, observed 2026-07-05T07:20:46.367552Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=pdf_text observed=2026-07-05T07:19:01.989427Z digest=sha256:1aa219bd4e59c9822d57d7cac52f1a9d7bc4f1b5b7d90205e928049e980419d7

Observation 8644411e-088a-42ff-8e80-a56acb2fa379 · inbound

PlayCoder: Making LLM-Generated GUI Code Playable cites this paper.

PlayCoder: Making LLM-Generated GUI Code Playable SWE-Bench+: Enhanced Coding Benchmark for LLMs

Reference 2

Resolution
verified exact
arxiv_id, observed 2026-05-11T13:16:18.332469Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=pdf_text observed=2026-05-10T02:02:01.395176Z digest=sha256:1b8d51fc6db1b158184f1daeca27c17da233279a188604a62709d5dbe6d34fc7

Observation 514c8e86-c50e-4e64-8c78-2c2856b3ce60 · inbound

The Conversations Beneath the Code: Triadic Data for Long-Horizon Software Engineering Agents cites this paper.

The Conversations Beneath the Code: Triadic Data for Long-Horizon Software Engineering Agents SWE-Bench+: Enhanced Coding Benchmark for LLMs

Reference 24

Resolution
verified exact
arxiv_id, observed 2026-05-09T06:25:39.786230Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=arxiv_source observed=2026-05-08T18:30:21.856024Z digest=sha256:5978bebbf604c6090a7aaa04e9bc6115515531dd58b900be23303e01686f33bf

Observation b3ec8b0d-554a-4710-89d4-434401d9793e · inbound

Coding Agents Don't Know When to Act cites this paper.

Coding Agents Don't Know When to Act SWE-Bench+: Enhanced Coding Benchmark for LLMs

Reference 1

Resolution
verified exact
arxiv_id, observed 2026-05-11T02:45:58.074555Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=pdf_text observed=2026-05-11T02:43:21.911437Z digest=sha256:220a63e5bcb656f1861d3e6f3e3f421f0c9c7d5caac079cb3c27604e01997e61

Observation 32d1af8b-1f24-4007-a172-c56beb2cce83 · inbound

From Patches to Trajectories: Privileged Process Supervision for Software-Engineering Agents cites this paper.

From Patches to Trajectories: Privileged Process Supervision for Software-Engineering Agents SWE-Bench+: Enhanced Coding Benchmark for LLMs

Reference 1

Resolution
metadata mismatch
arxiv_id, observed 2026-05-22T05:14:37.590109Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=pdf_text observed=2026-05-22T05:13:26.057531Z digest=sha256:5c1b27b29aba73acd05a04aa6d1ad8a0a7c390532455c3f9367446f901d5e688

Observation 91c5ad04-f5b0-404d-811d-91d711ec4459 · inbound

Anchor: Mitigating Artifact Drift in Agent Benchmark Generation cites this paper.

Anchor: Mitigating Artifact Drift in Agent Benchmark Generation SWE-Bench+: Enhanced Coding Benchmark for LLMs

Reference 1

Resolution
verified exact
arxiv_id, observed 2026-06-29T21:33:59.138712Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=pdf_text observed=2026-06-29T21:29:57.626069Z digest=sha256:0538f116040064c828b7244fbc61e8f37dec22e8ada216eaae0c8b7c67b5802a

Observation c5f9e042-b8c3-45b1-aea9-4fe307b18575 · inbound

Code-QA-Bench: Separating Code Reasoning from Documentation Memorization in Repository-Level QA cites this paper.

Code-QA-Bench: Separating Code Reasoning from Documentation Memorization in Repository-Level QA SWE-Bench+: Enhanced Coding Benchmark for LLMs

Reference 1

Resolution
metadata mismatch
arxiv_id, observed 2026-06-29T07:03:12.916559Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=pdf_text observed=2026-06-29T07:00:07.102425Z digest=sha256:fdb2af2bcb0575411b0a8b4b362a7fa4d291bccb61d7eaf0e4485a22c7ac36f3

Observation 5013e746-5aff-4c80-a489-d021058eac91 · inbound

I-WebGenBench : Evaluating Interactivity in LLM-Generated Scientific Web Applications cites this paper.

I-WebGenBench : Evaluating Interactivity in LLM-Generated Scientific Web Applications SWE-Bench+: Enhanced Coding Benchmark for LLMs

Reference 2

Resolution
metadata mismatch
arxiv_id, observed 2026-06-28T19:42:36.211391Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=pdf_text observed=2026-06-28T18:53:18.645984Z digest=sha256:87a7bf0e00ed03bc1df8f4854e9904238361339c9d3fec9ea8149efdd5cc062f

Observation bcfeee33-2178-4232-aa02-7999abfd4782 · inbound

TensorBench: Benchmarking Coding Agents on a Compiler-Based Tensor Framework cites this paper.

TensorBench: Benchmarking Coding Agents on a Compiler-Based Tensor Framework SWE-Bench+: Enhanced Coding Benchmark for LLMs

Reference 1

Resolution
metadata mismatch
arxiv_id, observed 2026-07-02T12:46:56.493122Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=pdf_text observed=2026-06-28T01:55:59.002171Z digest=sha256:e5499b25332ca6db50433177716437ef638f5fdf341544e5fa9254020331fd83

Observation 74a6e7ec-23b4-46e1-86ea-3b71d5864453 · inbound

Human Oversight and Overload: Two Hidden and Costly Burdens of AI-Assisted Software Engineering cites this paper.

Human Oversight and Overload: Two Hidden and Costly Burdens of AI-Assisted Software Engineering SWE-Bench+: Enhanced Coding Benchmark for LLMs

Reference 11

Resolution
metadata mismatch
arxiv_id, observed 2026-07-02T14:17:03.537753Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=pdf_text observed=2026-06-28T00:32:16.740994Z digest=sha256:597d36816872dca534f5bade4aa498cd32e1fe35b38d835d5a20d672170dc6a8

Observation 96715c5b-8349-4eba-9f9d-686873e19d27 · inbound

Position: Coding Benchmarks Are Misaligned with Agentic Software Engineering cites this paper.

Position: Coding Benchmarks Are Misaligned with Agentic Software Engineering SWE-Bench+: Enhanced Coding Benchmark for LLMs

Reference 2

Resolution
verified exact
arxiv_id, observed 2026-07-03T22:08:58.918137Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=pdf_text observed=2026-06-26T23:48:58.497927Z digest=sha256:54013f7a0f8552e969296c0ea13e92892bf3d794ecef009bbd5732a2d4e94438

Observation c8044ef7-40fa-4f3b-84f6-8e453a2a5e20 · inbound

Position: Coding Benchmarks Are Misaligned with Agentic Software Engineering cites this paper.

Position: Coding Benchmarks Are Misaligned with Agentic Software Engineering SWE-Bench+: Enhanced Coding Benchmark for LLMs

Reference 2

Resolution
unresolved
no resolver link, observed 2026-08-02T11:05:59.944027Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-02T11:05:59.944027Z digest=sha256:29918bc202e522cfd7edfd90c923789530510653f07dd1cab05bfe160a72a74d

Observation e17a204b-9cf9-4428-a277-273c667f27df · inbound

Breaking the Solver Bottleneck: Training Task Generators at the Learnable Frontier cites this paper.

Breaking the Solver Bottleneck: Training Task Generators at the Learnable Frontier SWE-Bench+: Enhanced Coding Benchmark for LLMs

Reference 50

Resolution
verified exact
arxiv_id, observed 2026-07-03T08:57:48.243351Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=arxiv_source observed=2026-06-27T10:36:09.211639Z digest=sha256:0a90553e40ab7d2292a4811eb2ce3a56acbe408752641445888538276439c80e

Observation 97eb9eae-2037-4c27-a592-2107b09e0fb7 · inbound

Code Isn't Memory: A Structural Codebase Index Inside a Coding Agent cites this paper.

Code Isn't Memory: A Structural Codebase Index Inside a Coding Agent SWE-Bench+: Enhanced Coding Benchmark for LLMs

Reference 3

Resolution
metadata mismatch
arxiv_id, observed 2026-07-04T08:49:41.772450Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=pdf_text observed=2026-06-26T10:59:52.756992Z digest=sha256:4916efc72718a2d3760ce5b25a18001a6e265c31a4813dbcf805c62099e76284

Observation d34adb41-8833-431e-8aca-e387f96dc721 · inbound

Helpful or Harmful? Evaluating LLM-Assisted Vulnerability Patching via a Human Study cites this paper.

Helpful or Harmful? Evaluating LLM-Assisted Vulnerability Patching via a Human Study SWE-Bench+: Enhanced Coding Benchmark for LLMs

Reference 17

Resolution
metadata mismatch
arxiv_id, observed 2026-07-04T21:10:09.273861Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=pdf_text observed=2026-06-25T19:02:45.109478Z digest=sha256:3ea5fcbaf8b327a21d04766af9cf1cb0ebae320d2afe3704c3d4d41cc8154416

Observation 21d2878d-09f4-4eec-995d-416e3da6ae80 · inbound

SWE-Router: Routing in Multi-turn Agentic Software Engineering Tasks cites this paper.

SWE-Router: Routing in Multi-turn Agentic Software Engineering Tasks SWE-Bench+: Enhanced Coding Benchmark for LLMs

Reference 31

Resolution
verified exact
arxiv_id, observed 2026-07-02T18:37:16.530676Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=arxiv_source observed=2026-07-02T18:19:43.146102Z digest=sha256:6bd0f0fa56c9f007b80ad88f80c6781644aa1ea1d20c8331203452a13dc81b6f

Observation a818805b-ade7-4898-bed3-a26264c355fc · inbound

RuBench: A Repository-Level Agentic Coding Benchmark with Natively Authored Russian Task Specifications cites this paper.

RuBench: A Repository-Level Agentic Coding Benchmark with Natively Authored Russian Task Specifications SWE-Bench+: Enhanced Coding Benchmark for LLMs

Reference 2

Resolution
verified exact
local_arxiv, observed 2026-07-08T07:04:44.545510Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=pdf_text observed=2026-07-08T06:55:40.830922Z digest=sha256:6c633cc422b28b38fc7ec4f05976aaf63194f25245c4acf9adeda8f7e2428f30

Observation 7f097b81-7b4e-4618-9fa7-f37081d6ea79 · inbound

RuBench: A Repository-Level Agentic Coding Benchmark with Natively Authored Russian Task Specifications cites this paper.

RuBench: A Repository-Level Agentic Coding Benchmark with Natively Authored Russian Task Specifications SWE-Bench+: Enhanced Coding Benchmark for LLMs

Reference 2

Resolution
unresolved
no resolver link, observed 2026-08-02T08:21:49.775844Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-02T08:21:49.775844Z digest=sha256:12fec37e34e98163f6ccb9bb76d3fbf3a69e4a479993cc16749c7a7b69a57886

Observation 6ac850aa-93ec-4f35-af31-facf3bda70a1 · inbound

What Makes a Good Bug Report for an AI Agent? cites this paper.

What Makes a Good Bug Report for an AI Agent? SWE-Bench+: Enhanced Coding Benchmark for LLMs

Reference 24

Resolution
metadata mismatch
local_arxiv, observed 2026-07-09T06:06:01.701427Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=pdf_text observed=2026-07-09T05:57:49.053868Z digest=sha256:edf3f5b6ee828ca24e3c87998433c0356faf5b5575315771e1741d0d87d69493

Observation b0533e7d-7473-4b5e-bacb-f0655eb0f325 · inbound

Deep Interaction: An Efficient Human-AI Interaction Method for Large Reasoning Models cites this paper.

Deep Interaction: An Efficient Human-AI Interaction Method for Large Reasoning Models SWE-Bench+: Enhanced Coding Benchmark for LLMs

Reference 2024

Resolution
unresolved
no resolver link, observed 2026-08-02T03:01:40.820412Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-02T03:01:40.820412Z digest=sha256:927b6a3a77d8b5be9442e1f40676b45a3ce51b8f10f84289600c38e1f171aa6c

Observation 9ad5f78a-feae-458e-8159-6525e23e059e · inbound

PAIChecker: Uncovering and Checking PR-Issue Misalignment in SWE-Bench-Like Benchmarks cites this paper.

PAIChecker: Uncovering and Checking PR-Issue Misalignment in SWE-Bench-Like Benchmarks SWE-Bench+: Enhanced Coding Benchmark for LLMs

Reference 15

Resolution
unresolved
no resolver link, observed 2026-07-31T03:01:03.575538Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-31T03:01:03.575538Z digest=sha256:5afc68f85f7c67d1c3fe1d6ec828709a40ed4077912416a4f59cb0e388035052

Observation 4d0f7d26-67ee-4a82-911d-41e3cf95e93a · inbound

PAIChecker: Uncovering and Checking PR-Issue Misalignment in SWE-Bench-Like Benchmarks cites this paper.

PAIChecker: Uncovering and Checking PR-Issue Misalignment in SWE-Bench-Like Benchmarks SWE-Bench+: Enhanced Coding Benchmark for LLMs

Reference 15

Resolution
unresolved
no resolver link, observed 2026-08-05T04:24:46.006089Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T04:24:46.006089Z digest=sha256:a4b766829643225c59b6a960326231a2c20d712c7d1daf8f0c8950d01735bdaf

Observation 64ba4e39-b21a-4b0a-9c41-5cddd61a9a18 · inbound

Active-SWE: Benchmarking Coding Agents for Proactive Bug Fixing without Issue Reports cites this paper.

Active-SWE: Benchmarking Coding Agents for Proactive Bug Fixing without Issue Reports SWE-Bench+: Enhanced Coding Benchmark for LLMs

Reference 16

Resolution
unresolved
no resolver link, observed 2026-08-06T19:02:40.376652Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-06T19:02:40.376652Z digest=sha256:93cff4a13caaf7dfff127a268c9dd2270fcdfcb92f9110b4a1130a75a169b613

Observation b4660dad-0725-4a6e-ae3e-a9009c2266ea · inbound

The Horizon Gap: Planning, Memory, Execution, Training, and Evaluation for Long-Horizon LLM Agents cites this paper.

The Horizon Gap: Planning, Memory, Execution, Training, and Evaluation for Long-Horizon LLM Agents SWE-Bench+: Enhanced Coding Benchmark for LLMs

Reference 103

Resolution
unresolved
no resolver link, observed 2026-08-10T23:01:35.771043Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T23:01:35.771043Z digest=sha256:9a1682ba2e2912412dd396ea90aee129e7823d7ccdaec552e2e12d36efe655a7

Observation 220ce96b-cc93-4b25-b1a9-999fa60dbb0f · inbound

Tangent: An Empirical Study of Testing Practices for LLM-Based Agent Applications cites this paper.

Tangent: An Empirical Study of Testing Practices for LLM-Based Agent Applications SWE-Bench+: Enhanced Coding Benchmark for LLMs

Reference 3

Resolution
unresolved
no resolver link, observed 2026-08-14T04:39:14.638892Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-14T04:39:14.638892Z digest=sha256:bdffab3ddbb6f05f21871cbf1e4189a0a1d79e93806d3010221f305080031c51