Pith. sign in

Paper Citation Record · LEDGER

TESTEVAL: Benchmarking Large Language Models for Test Case Generation

As of 8 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 16 inbound Pith citation observations for arXiv:2406.04531.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2406.04531 v2

Coverage vector

measured 0 of 0 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links

measured 16 of 16 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-08T06:32:00.761636+00:00

measured 16 of 16 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links, observed 2026-08-07T23:42:26.077466Z

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: arxiv_reference, observed 2026-05-23T03:45:21.838589Z

Reference resolution

0 of 0 outbound references displayed

  • verified exact0
  • verified fuzzy0
  • unresolved0
  • parse uncertain0
  • malformed identifier0
  • metadata mismatch0

External citation measurements

No source-named external measurement is stored.

Outbound references

No outbound reference observations are available for this paper version.

Pith citing papers

Observation e62d82f9-7f1f-4ba6-b0d1-9ee74177fabb · inbound

MultiFileTest: A Multi-File-Level LLM Unit Test Generation Benchmark and Impact of Error Fixing Mechanisms cites this paper.

MultiFileTest: A Multi-File-Level LLM Unit Test Generation Benchmark and Impact of Error Fixing Mechanisms TESTEVAL: Benchmarking Large Language Models for Test Case Generation

Reference 27

Resolution
verified exact
arxiv_id, observed 2026-05-23T03:45:21.841847Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=arxiv_source observed=2026-05-23T03:42:36.946141Z digest=sha256:1030d784266614862aa52ed8904f7bfe34e58e46849658d60c58592fc7b4d892

Observation a243c40a-07ad-4554-8a41-896446ed20d4 · inbound

CLOVER: A Test Case Generation Benchmark with Coverage, Long-Context, and Verification cites this paper.

CLOVER: A Test Case Generation Benchmark with Coverage, Long-Context, and Verification TESTEVAL: Benchmarking Large Language Models for Test Case Generation

Reference 34

Resolution
unresolved
no resolver link, observed 2026-08-07T23:42:26.077466Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T23:42:26.077466Z digest=sha256:0a151d205346a8f16ace2302e43ff6c42703eda41ecdf334299c3a87f399b3c6

Observation 3c25c92e-8739-4e20-a05a-7a6aa9a60f6c · inbound

LogiCase: Effective Test Case Generation from Logical Description in Competitive Programming cites this paper.

LogiCase: Effective Test Case Generation from Logical Description in Competitive Programming TESTEVAL: Benchmarking Large Language Models for Test Case Generation

Reference 21

Resolution
unresolved
no resolver link, observed 2026-08-07T15:29:29.018544Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T15:29:29.018544Z digest=sha256:943712c584ea5527c54814f3948bbfc17274743b1eec584a7ea6a7d9c53e50e8

Observation 9d92569e-dd0a-41c5-9707-ddcccb60ff5d · inbound

HardTests: Synthesizing High-Quality Test Cases for LLM Coding cites this paper.

HardTests: Synthesizing High-Quality Test Cases for LLM Coding TESTEVAL: Benchmarking Large Language Models for Test Case Generation

Reference 23

Resolution
unresolved
no resolver link, observed 2026-08-07T12:39:57.721681Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T12:39:57.721681Z digest=sha256:f763165bb0b5dcdfd5845075b27d416475ea5798fb2c99d314a380a96340b1f8

Observation c8dd2967-7dad-4ddb-92c4-0b4440ca6fe5 · inbound

SAGE:Specification-Aware Grammar Extraction for Automated Test Case Generation with LLMs cites this paper.

SAGE:Specification-Aware Grammar Extraction for Automated Test Case Generation with LLMs TESTEVAL: Benchmarking Large Language Models for Test Case Generation

Reference 32

Resolution
unresolved
no resolver link, observed 2026-08-07T11:00:46.175257Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T11:00:46.175257Z digest=sha256:95d9715e8630bb5c1987c6d1e83995992a0db684b24028e829e3d4d0ea1beae7

Observation 572a3131-a99b-4f23-952b-17e21831f1ab · inbound

Can LLMs Generate High-Quality Test Cases for Algorithm Problems? TestCase-Eval: A Systematic Evaluation of Fault Coverage and Exposure cites this paper.

Can LLMs Generate High-Quality Test Cases for Algorithm Problems? TestCase-Eval: A Systematic Evaluation of Fault Coverage and Exposure TESTEVAL: Benchmarking Large Language Models for Test Case Generation

Reference 26

Resolution
unresolved
no resolver link, observed 2026-08-07T00:59:56.751560Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T00:59:56.751560Z digest=sha256:22c5f3a10661dc2e9ba9dffe2a87810064f0c402954d906b4ac5705eae054995

Observation b1dfdd0d-4132-4f74-812e-af48be32b323 · inbound

Rethinking Verification for LLM Code Generation: From Generation to Testing cites this paper.

Rethinking Verification for LLM Code Generation: From Generation to Testing TESTEVAL: Benchmarking Large Language Models for Test Case Generation

Reference 41

Resolution
unresolved
no resolver link, observed 2026-08-06T18:58:21.179980Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T18:58:21.179980Z digest=sha256:443bb5860d6757fda150c59609546dbf3fcc487079ef4dc4461c741c7aae7850

Observation 29603517-e653-4063-81b1-b10fab08a9be · inbound

Benchmarking LLMs for Unit Test Generation from Real-World Functions cites this paper.

Benchmarking LLMs for Unit Test Generation from Real-World Functions TESTEVAL: Benchmarking Large Language Models for Test Case Generation

Reference 5

Resolution
unresolved
no resolver link, observed 2026-08-06T10:15:37.152164Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T10:15:37.152164Z digest=sha256:93329f21e29c75d8d1ae87aa0dd4cf2ae424fc86f716cb418b15b27712916571

Observation 214df8df-4d55-4d8b-8b60-df4ca738944b · inbound

HyClone: Bridging LLM Understanding and Dynamic Execution for Semantic Code Clone Detection cites this paper.

HyClone: Bridging LLM Understanding and Dynamic Execution for Semantic Code Clone Detection TESTEVAL: Benchmarking Large Language Models for Test Case Generation

Reference 18

Resolution
unresolved
no resolver link, observed 2026-08-06T05:41:35.125310Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-06T05:41:35.125310Z digest=sha256:bbbb9827dd32956a78f18fcee0551395275684662123f7d883d62a2871a88fa0

Observation 51e82265-4c6e-475d-b8c2-67658a7c9de5 · inbound

Trade Policy and Structural Change cites this paper.

Trade Policy and Structural Change TESTEVAL: Benchmarking Large Language Models for Test Case Generation

Reference 18

Resolution
unresolved
no resolver link, observed 2026-08-06T05:42:31.110819Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T05:42:31.110819Z digest=sha256:5647b8641a8c15aebe763d06183acd1546d2311701e01f9d1f0e614ef682b427

Observation f1ef20a3-8da8-4d4d-8f12-4e68ed204cb4 · inbound

Comparative Evaluation of Large Language Models for Test-Skeleton Generation cites this paper.

Comparative Evaluation of Large Language Models for Test-Skeleton Generation TESTEVAL: Benchmarking Large Language Models for Test Case Generation

Reference 26

Resolution
unresolved
no resolver link, observed 2026-08-05T05:59:43.828934Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T05:59:43.828934Z digest=sha256:c80b78d09da47925cfd01c43ed7d846ce1df70a9c899865662e92ae24d548b03

Observation 38fcef46-524a-4424-b4da-f838e2524139 · inbound

SWE-EVO: Benchmarking Coding Agents in Long-Horizon Software Evolution Scenarios cites this paper.

SWE-EVO: Benchmarking Coding Agents in Long-Horizon Software Evolution Scenarios TESTEVAL: Benchmarking Large Language Models for Test Case Generation

Reference 48

Resolution
verified exact
arxiv_id, observed 2026-05-16T20:28:24.556378Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=arxiv_source observed=2026-05-16T20:24:40.939455Z digest=sha256:916c6412edc8cb1b5247089fde26bd929da73363ebdf9575e3df80880f8ae5d6

Observation 85fa6c92-2013-42c9-891f-6a7e09f2217b · inbound

WebMAC: A Multi-Agent Collaborative Framework for Scenario Testing of Web Systems cites this paper.

WebMAC: A Multi-Agent Collaborative Framework for Scenario Testing of Web Systems TESTEVAL: Benchmarking Large Language Models for Test Case Generation

Reference 11

Resolution
verified exact
arxiv_id, observed 2026-05-10T13:45:28.438819Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-05-10T13:41:03.668751Z digest=sha256:5f18b624f354c6f09743239cafbddd8b143c1ecc5120ef7dbccbde6b133252e9

Observation b969a3ee-17eb-413c-8bd2-5218a0ec3286 · inbound

Enhancing Large Language Models with Retrieval Augmented Generation for Software Testing and Inspection Automation cites this paper.

Enhancing Large Language Models with Retrieval Augmented Generation for Software Testing and Inspection Automation TESTEVAL: Benchmarking Large Language Models for Test Case Generation

Reference 11

Resolution
verified exact
arxiv_id, observed 2026-05-10T10:44:37.956799Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-05-10T10:40:30.734804Z digest=sha256:ca36b291cc969138c5ff1be62dc3ba363c8dbd5ee71e9d516a68a26160167bba

Observation 186f474c-93d4-4942-af0e-5c2d5ddf9276 · inbound

SWE-Cycle: Benchmarking Code Agents across the Complete Issue Resolution Cycle cites this paper.

SWE-Cycle: Benchmarking Code Agents across the Complete Issue Resolution Cycle TESTEVAL: Benchmarking Large Language Models for Test Case Generation

Reference 33

Resolution
verified exact
arxiv_id, observed 2026-05-14T18:37:35.700926Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-05-14T18:34:39.997353Z digest=sha256:805acbd22873009d4bfaf9ba7c32eb257b7d07474312d11974c56310906f6ea3

Observation 7d6fcf0e-0f6f-4658-b4c6-e4c008823898 · inbound

SCATE: Learning to Supervise Coding Agents for Cost-Effective Test Generation cites this paper.

SCATE: Learning to Supervise Coding Agents for Cost-Effective Test Generation TESTEVAL: Benchmarking Large Language Models for Test Case Generation

Reference 51

Resolution
unresolved
no resolver link, observed 2026-07-13T01:15:01.090791Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-13T01:15:01.090791Z digest=sha256:c54fd291bf4ae50046d0934d132094f85e30af5f9cf9995f1dcdb72a3524a373