Pith. sign in

Paper Citation Record · LEDGER

SWE-MERA: A Dynamic Benchmark for Agenticly Evaluating Large Language Models on Software Engineering Tasks

As of 18 August 2026, this Paper Citation Record lists 13 of 13 outbound references and 3 inbound Pith citation observations for arXiv:2507.11059.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2507.11059 v3

Coverage vector

measured 13 of 13 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links, observed 2026-08-06T17:23:32.774387Z

measured 16 of 16 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-18T06:34:40.430872+00:00

measured 3 of 3 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links, observed 2026-08-10T23:01:35.774091Z

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: pith, observed 2026-07-08T07:04:44.553235Z

Reference resolution

13 of 13 outbound references displayed

  • verified exact0
  • verified fuzzy0
  • unresolved13
  • parse uncertain0
  • malformed identifier0
  • metadata mismatch0

External citation measurements

No source-named external measurement is stored.

Outbound references

Observation 522319be-0f16-4023-a4d8-71ab6f5f9fd5 · outbound

This paper cites online" 'onlinestring :=.

SWE-MERA: A Dynamic Benchmark for Agenticly Evaluating Large Language Models on Software Engineering Tasks online" 'onlinestring :=

Reference 1

Resolution
unresolved
no resolver link, observed 2026-08-06T17:23:31.554040Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-06T17:23:31.554040Z digest=sha256:ea940b7fa473c70c0af75f15da93235e2837907d8171818f7a485e7dd480ac34

Observation ab8db74e-8677-4fcd-aa93-0816f2d8ef0f · outbound

This paper cites write newline.

SWE-MERA: A Dynamic Benchmark for Agenticly Evaluating Large Language Models on Software Engineering Tasks write newline

Reference 2

Resolution
unresolved
no resolver link, observed 2026-08-06T17:23:31.638050Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-06T17:23:31.638050Z digest=sha256:0927396c70779b5a58cec4c0927de00a369281b4838a023bf40b0a4673fe49ed

Observation d597f088-f028-4633-961e-c630e8acdb65 · outbound

This paper cites SWE-Bench+: Enhanced Coding Benchmark for LLMs.

SWE-MERA: A Dynamic Benchmark for Agenticly Evaluating Large Language Models on Software Engineering Tasks SWE-Bench+: Enhanced Coding Benchmark for LLMs

Reference 3

Resolution
unresolved
no resolver link, observed 2026-08-06T17:23:31.742334Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-06T17:23:31.742334Z digest=sha256:20816bda7ac932c3ed8f252a5243f1684916288f7e4d24c6cffdd2f09e0fee9b

Observation 05a5ca85-3c73-4f89-91e0-8424e04323e2 · outbound

This paper cites DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning.

SWE-MERA: A Dynamic Benchmark for Agenticly Evaluating Large Language Models on Software Engineering Tasks DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning

Reference 4

Resolution
unresolved
no resolver link, observed 2026-08-06T17:23:31.863826Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-06T17:23:31.863826Z digest=sha256:95821d0094d3a49a893b77cfabd50fcaa9bd005850c35a99691c6021d6b5f3ea

Observation 88c76691-db89-4dd7-8a6c-9620c427d861 · outbound

This paper cites Qwen2.5-Coder Technical Report.

SWE-MERA: A Dynamic Benchmark for Agenticly Evaluating Large Language Models on Software Engineering Tasks Qwen2.5-Coder Technical Report

Reference 5

Resolution
unresolved
no resolver link, observed 2026-08-06T17:23:31.983323Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-06T17:23:31.983323Z digest=sha256:b074d9ded83a3baae8dad64f174536f01c43309c456becfafbd838c80e3a2197

Observation b12e7bcb-9458-4b80-b0d9-2145d51f405d · outbound

This paper cites LiveCodeBench: Holistic and Contamination Free Evaluation of Large Language Models for Code.

SWE-MERA: A Dynamic Benchmark for Agenticly Evaluating Large Language Models on Software Engineering Tasks LiveCodeBench: Holistic and Contamination Free Evaluation of Large Language Models for Code

Reference 6

Resolution
unresolved
no resolver link, observed 2026-08-06T17:23:32.089123Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-06T17:23:32.089123Z digest=sha256:ea04b112573f1d677ede365f746055fe5827e68cf6b8ec72e0ac03b5080adbe3

Observation 2a49d633-9b25-4c0f-827a-bdc085364b3b · outbound

This paper cites SWE-bench: Can Language Models Resolve Real-World GitHub Issues?.

SWE-MERA: A Dynamic Benchmark for Agenticly Evaluating Large Language Models on Software Engineering Tasks SWE-bench: Can Language Models Resolve Real-World GitHub Issues?

Reference 7

Resolution
unresolved
no resolver link, observed 2026-08-06T17:23:32.208207Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-06T17:23:32.208207Z digest=sha256:2fb316d33403733ec3a675af39c367a0e989aa0e0423f23697a602e5f8a929f3

Observation d40b88ce-95d8-41bb-b4e0-dba096edcfa4 · outbound

This paper cites Training Software Engineering Agents and Verifiers with SWE-Gym.

SWE-MERA: A Dynamic Benchmark for Agenticly Evaluating Large Language Models on Software Engineering Tasks Training Software Engineering Agents and Verifiers with SWE-Gym

Reference 8

Resolution
unresolved
no resolver link, observed 2026-08-06T17:23:32.338078Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-06T17:23:32.338078Z digest=sha256:d97eff0215a02a101c3305bb42b048c3a4ae81870002dc14dfccdc7f63fd27e4

Observation 385ade8c-74be-42a5-93d6-d511c1c86999 · outbound

This paper cites an unresolved cited work.

SWE-MERA: A Dynamic Benchmark for Agenticly Evaluating Large Language Models on Software Engineering Tasks Unresolved cited work

Reference 9

Resolution
unresolved
no resolver link, observed 2026-08-06T17:23:32.463424Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-06T17:23:32.463424Z digest=sha256:2f81aa3830f167f04324e84516ec673c2243d238c71583a4b4f96b59fc497aec

Observation eaa81217-c354-40cf-bc03-7d6e0cc5a7bc · outbound

This paper cites Qwen3 Technical Report.

SWE-MERA: A Dynamic Benchmark for Agenticly Evaluating Large Language Models on Software Engineering Tasks Qwen3 Technical Report

Reference 10

Resolution
unresolved
no resolver link, observed 2026-08-06T17:23:32.561248Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-06T17:23:32.561248Z digest=sha256:697cfac1638b143b4e9fa81340becc88855037e03ee2599f23c3b11899dfbcc1

Observation b50e8b67-0ba7-4a18-b4b6-31a3cd5258ab · outbound

This paper cites Qwen2.5 Technical Report.

SWE-MERA: A Dynamic Benchmark for Agenticly Evaluating Large Language Models on Software Engineering Tasks Qwen2.5 Technical Report

Reference 11

Resolution
unresolved
no resolver link, observed 2026-08-06T17:23:32.632089Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-06T17:23:32.632089Z digest=sha256:2aefaeaed0d08c2123c96ad86bd2df719a1919015275ea4873cd9e42d8ddcc6e

Observation ba76c1e7-a3b9-4e89-b264-d8b8dfc199b5 · outbound

This paper cites SWE-smith: Scaling Data for Software Engineering Agents.

SWE-MERA: A Dynamic Benchmark for Agenticly Evaluating Large Language Models on Software Engineering Tasks SWE-smith: Scaling Data for Software Engineering Agents

Reference 12

Resolution
unresolved
no resolver link, observed 2026-08-06T17:23:32.695270Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-06T17:23:32.695270Z digest=sha256:979438926a57794cbc3c268185d36540dbe1733ffa0de5f4c033183ce8e019ec

Observation 47d99099-fcc2-423c-96d7-957e3e954dc6 · outbound

This paper cites Multi-SWE-bench: A Multilingual Benchmark for Issue Resolving.

SWE-MERA: A Dynamic Benchmark for Agenticly Evaluating Large Language Models on Software Engineering Tasks Multi-SWE-bench: A Multilingual Benchmark for Issue Resolving

Reference 13

Resolution
unresolved
no resolver link, observed 2026-08-06T17:23:32.774387Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-06T17:23:32.774387Z digest=sha256:ae84ba73c9a6ab004fcbae6605544676670047f6971084ee06506f48bb603654

Pith citing papers

Observation 361e4e2a-fec5-4709-b57d-e0f611e9d605 · inbound

RuBench: A Repository-Level Agentic Coding Benchmark with Natively Authored Russian Task Specifications cites this paper.

RuBench: A Repository-Level Agentic Coding Benchmark with Natively Authored Russian Task Specifications SWE-MERA: A Dynamic Benchmark for Agenticly Evaluating Large Language Models on Software Engineering Tasks

Reference 7

Resolution
verified exact
local_arxiv, observed 2026-07-08T07:04:44.554643Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-07-08T06:55:40.830922Z digest=sha256:ea7ef381851508c69f00f9ad7639c97a8c6aaaeaae7f27c088821aedd9cce78b

Observation ca14c0ea-849c-4e29-b863-c20cd752f562 · inbound

RuBench: A Repository-Level Agentic Coding Benchmark with Natively Authored Russian Task Specifications cites this paper.

RuBench: A Repository-Level Agentic Coding Benchmark with Natively Authored Russian Task Specifications SWE-MERA: A Dynamic Benchmark for Agenticly Evaluating Large Language Models on Software Engineering Tasks

Reference 7

Resolution
unresolved
no resolver link, observed 2026-08-02T08:21:50.116198Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-02T08:21:50.116198Z digest=sha256:9d133e461f4bde5d160060193702d85a77d9a5fc4e3fbe76875239507d92fe0a

Observation 1ace0f74-a7fd-4d09-97ad-8c1d4715aed4 · inbound

The Horizon Gap: Planning, Memory, Execution, Training, and Evaluation for Long-Horizon LLM Agents cites this paper.

The Horizon Gap: Planning, Memory, Execution, Training, and Evaluation for Long-Horizon LLM Agents SWE-MERA: A Dynamic Benchmark for Agenticly Evaluating Large Language Models on Software Engineering Tasks

Reference 104

Resolution
unresolved
no resolver link, observed 2026-08-10T23:01:35.774091Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T23:01:35.774091Z digest=sha256:25c35f0008efb5e3be1f4ffe755aeb536e9a593bb1c004c56e1d386e7b310d55