Pith. sign in

Paper Citation Record · LEDGER

SwiftEval: Developing a Language-Specific Benchmark for LLM-generated Code Evaluation

As of 10 August 2026, this Paper Citation Record lists 31 of 31 outbound references and 0 inbound Pith citation observations for arXiv:2505.24324.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2505.24324 v1

Coverage vector

measured 31 of 31 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links, observed 2026-08-07T12:29:19.342174Z

measured 31 of 31 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-09T06:31:02.800959+00:00

measured 0 of 0 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: cited_works

Reference resolution

31 of 31 outbound references displayed

  • verified exact3
  • verified fuzzy11
  • unresolved17
  • parse uncertain0
  • malformed identifier0
  • metadata mismatch0

External citation measurements

No source-named external measurement is stored.

Outbound references

Observation beea5b85-87fa-4e8f-af78-6c00c5c3b812 · outbound

This paper cites Evaluating Large Language Models Trained on Code.

SwiftEval: Developing a Language-Specific Benchmark for LLM-generated Code Evaluation Evaluating Large Language Models Trained on Code

Reference 1

Resolution
unresolved
no resolver link, observed 2026-08-07T12:29:16.723342Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T12:29:16.723342Z digest=sha256:721ecd01cee56caa1f14622a5b03f84ef0c5f070e61057177e51bbd700f4ef57

Observation fdfd9c76-f6c0-43a0-b88d-7513e345f0ed · outbound

This paper cites CodeGen: An Open Large Language Model for Code with Multi-Turn Program Synthesis,.

SwiftEval: Developing a Language-Specific Benchmark for LLM-generated Code Evaluation CodeGen: An Open Large Language Model for Code with Multi-Turn Program Synthesis,

Reference 2

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T12:29:24.765437Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-08-07T12:29:16.771938Z digest=sha256:a67b57eb4a7f9840e7448a2811b9d30973080901e6ddd653781148f71ff117b2

Observation a7abdd35-4b4e-412e-b899-3b8573467071 · outbound

This paper cites A Systematic Evaluation of Large Language Models of Code.

SwiftEval: Developing a Language-Specific Benchmark for LLM-generated Code Evaluation A Systematic Evaluation of Large Language Models of Code

Reference 3

Resolution
unresolved
no resolver link, observed 2026-08-07T12:29:16.864754Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T12:29:16.864754Z digest=sha256:924cf04bf65b1384052979c491efbe3ee081451f60ae39e62e6ea082cb9ab051

Observation c225c370-6ffa-4b0f-ac48-1692011462c6 · outbound

This paper cites DeepSeek-Coder: When the Large Language Model Meets Programming -- The Rise of Code Intelligence.

SwiftEval: Developing a Language-Specific Benchmark for LLM-generated Code Evaluation DeepSeek-Coder: When the Large Language Model Meets Programming -- The Rise of Code Intelligence

Reference 4

Resolution
unresolved
no resolver link, observed 2026-08-07T12:29:17.012603Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T12:29:17.012603Z digest=sha256:5744a7a9b10cf23d64774de0e93d3401cd22dc749127348eb34388e5b36630ed

Observation 179b10cf-8abc-4b9c-b004-bbf94ff66f0c · outbound

This paper cites Code Llama: Open Foundation Models for Code,.

SwiftEval: Developing a Language-Specific Benchmark for LLM-generated Code Evaluation Code Llama: Open Foundation Models for Code,

Reference 5

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T12:29:24.516278Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-08-07T12:29:17.072363Z digest=sha256:08afe88bf021c75b385d0eca1841951e1bb04b2b8e122348303b9cd128970235

Observation e80f189a-dbe1-49ed-aeab-78742db7615c · outbound

This paper cites Code Completion by Modeling Flattened Abstract Syntax Trees as Graphs,.

SwiftEval: Developing a Language-Specific Benchmark for LLM-generated Code Evaluation Code Completion by Modeling Flattened Abstract Syntax Trees as Graphs,

Reference 6

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T12:29:24.238411Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-08-07T12:29:17.100223Z digest=sha256:655e21c57126f9039f6811492fb70242f75b0e917e1f18ec85ff2cb51adc3046

Observation 993299aa-b9fc-4646-bcbb-4c01309223e5 · outbound

This paper cites Lost in Translation: A Study of Bugs Introduced by Large Language Models while Translating Code,.

SwiftEval: Developing a Language-Specific Benchmark for LLM-generated Code Evaluation Lost in Translation: A Study of Bugs Introduced by Large Language Models while Translating Code,

Reference 7

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T12:29:24.005177Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-08-07T12:29:17.154474Z digest=sha256:6e8fccc53758abe8af07c85cae03284fa99e97f6179062cd9fa68adcc1418358

Observation f2b866d3-1975-437f-bd25-af74eacae51b · outbound

This paper cites Few-shot training LLMs for project-specific code-summarization.

SwiftEval: Developing a Language-Specific Benchmark for LLM-generated Code Evaluation Few-shot training LLMs for project-specific code-summarization

Reference 8

Resolution
verified exact
local_arxiv, observed 2026-08-07T12:29:21.221743Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-08-07T12:29:17.205650Z digest=sha256:a7360ef8f2738648ffccdfc6d853f326fbd8bee9954921fa0632d067e702db2f

Observation 187c8295-2312-4503-9d86-e9a619655250 · outbound

This paper cites Program Synthesis with Large Language Models.

SwiftEval: Developing a Language-Specific Benchmark for LLM-generated Code Evaluation Program Synthesis with Large Language Models

Reference 9

Resolution
unresolved
no resolver link, observed 2026-08-07T12:29:17.258721Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T12:29:17.258721Z digest=sha256:c256a4f8df230f8e1b831db852a1c1cccb7c18ad6f87c444af39b8f3bdc665ea

Observation 1ee8ea2e-ba01-48dd-b29d-1ce5a23110e6 · outbound

This paper cites Multi-lingual Evaluation of Code Generation Models,.

SwiftEval: Developing a Language-Specific Benchmark for LLM-generated Code Evaluation Multi-lingual Evaluation of Code Generation Models,

Reference 10

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T12:29:23.771090Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-08-07T12:29:17.357832Z digest=sha256:f4664f454f10780b8af807f467c0b4787eaab8f5f1b3719c3d70775e8d6defcf

Observation 4e8e84b3-d10f-49f2-b574-4d8f8eaf4e04 · outbound

This paper cites Large Language Models Meet NL2Code: A Survey.

SwiftEval: Developing a Language-Specific Benchmark for LLM-generated Code Evaluation Large Language Models Meet NL2Code: A Survey

Reference 11

Resolution
unresolved
no resolver link, observed 2026-08-07T12:29:17.440179Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T12:29:17.440179Z digest=sha256:907c5ba9937a25a82f46fbff2b4ccd4e689affb76b1dd35ad840e6233c7af8a3

Observation ba0c226f-54b7-4ea7-9d9a-fd90facb5e6b · outbound

This paper cites Measuring Coding Challenge Competence With APPS.

SwiftEval: Developing a Language-Specific Benchmark for LLM-generated Code Evaluation Measuring Coding Challenge Competence With APPS

Reference 12

Resolution
unresolved
no resolver link, observed 2026-08-07T12:29:17.540016Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T12:29:17.540016Z digest=sha256:3e9e8238b0487831e76ccd1623c2550c30fdcc3d92281c630d5254dfc21982fe

Observation fcc5be15-61c6-4ab8-9267-2194bece6ba9 · outbound

This paper cites CodeGen: An Open Large Language Model for Code with Multi-Turn Program Synthesis.

SwiftEval: Developing a Language-Specific Benchmark for LLM-generated Code Evaluation CodeGen: An Open Large Language Model for Code with Multi-Turn Program Synthesis

Reference 13

Resolution
unresolved
no resolver link, observed 2026-08-07T12:29:17.628104Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T12:29:17.628104Z digest=sha256:321e94ec916eabc55237397f74dd1f5bcbb8d4f377d3fa9ee76d50933e1257a1

Observation b966ab95-d45a-4334-a0b9-ba15c86ccff5 · outbound

This paper cites MultiPL-E: A Scalable and Extensible Approach to Benchmarking Neural Code Generation,.

SwiftEval: Developing a Language-Specific Benchmark for LLM-generated Code Evaluation MultiPL-E: A Scalable and Extensible Approach to Benchmarking Neural Code Generation,

Reference 14

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T12:29:23.566218Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-08-07T12:29:17.720704Z digest=sha256:875ab07045d3457c5b99739ffc52744239adeff018509c3e080ede6083936455

Observation 08259e35-cb6d-4722-9b32-b986b9a79b8e · outbound

This paper cites HumanEval-XL: A Multilingual Code Generation Benchmark for Cross-lingual Natural Language Generalization.

SwiftEval: Developing a Language-Specific Benchmark for LLM-generated Code Evaluation HumanEval-XL: A Multilingual Code Generation Benchmark for Cross-lingual Natural Language Generalization

Reference 15

Resolution
unresolved
no resolver link, observed 2026-08-07T12:29:17.936773Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T12:29:17.936773Z digest=sha256:087bf874856536e5622bbbbfc53fc313637b86ee2e7f05cc684d94250dfbb4ee

Observation 28ff50ae-dac9-4b29-ad6e-4aa66b623c37 · outbound

This paper cites The RedMonk Programming Language Rankings: June 2024,.

SwiftEval: Developing a Language-Specific Benchmark for LLM-generated Code Evaluation The RedMonk Programming Language Rankings: June 2024,

Reference 17

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T12:29:23.204754Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-08-07T12:29:18.074472Z digest=sha256:f369d4205d61155dfb59e5ee1eab9e6059f43108a93b823a4fdfb5993a9a1b69

Observation 17e14ba7-40c0-475d-9163-b51da64b5e20 · outbound

This paper cites BLEU: a method for automatic evaluation of machine translation,.

SwiftEval: Developing a Language-Specific Benchmark for LLM-generated Code Evaluation BLEU: a method for automatic evaluation of machine translation,

Reference 18

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T12:29:22.910899Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-08-07T12:29:18.185855Z digest=sha256:be03610bf7085e80fe7722f661ee3be26cc304ee482c7ce634d1ac82d4c03808

Observation 889cb942-2ff9-4f1b-844a-d6d684838f2d · outbound

This paper cites CodeBLEU: a Method for Automatic Evaluation of Code Synthesis.

SwiftEval: Developing a Language-Specific Benchmark for LLM-generated Code Evaluation CodeBLEU: a Method for Automatic Evaluation of Code Synthesis

Reference 19

Resolution
unresolved
no resolver link, observed 2026-08-07T12:29:18.364837Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T12:29:18.364837Z digest=sha256:c088723476e9a017d5ad8b566328daed00b373c29c8533cba85348375f5b1f9f

Observation fb1ad3e0-5e03-4ab1-aeff-d7c4f5f9f56d · outbound

This paper cites Rethinking Benchmark and Contamination for Language Models with Rephrased Samples.

SwiftEval: Developing a Language-Specific Benchmark for LLM-generated Code Evaluation Rethinking Benchmark and Contamination for Language Models with Rephrased Samples

Reference 20

Resolution
unresolved
no resolver link, observed 2026-08-07T12:29:18.525978Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T12:29:18.525978Z digest=sha256:45845cdbd096c0f51c412856f84799d97b9b31a386eb4e52e90574cabe8ae93a

Observation e5e5128d-a80f-418b-8437-e1711082ceea · outbound

This paper cites DS-1000: A Natural and Reliable Benchmark for Data Science Code Generation.

SwiftEval: Developing a Language-Specific Benchmark for LLM-generated Code Evaluation DS-1000: A Natural and Reliable Benchmark for Data Science Code Generation

Reference 21

Resolution
unresolved
no resolver link, observed 2026-08-07T12:29:18.701253Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T12:29:18.701253Z digest=sha256:ace0b07cb42b575799524a2c2e287d440bc27bab3522368dbe8159cd80936bce

Observation a067a680-2594-451c-a942-61d846b27d0d · outbound

This paper cites ClassEval: A Manually-Crafted Benchmark for Evaluating LLMs on Class-level Code Generation.

SwiftEval: Developing a Language-Specific Benchmark for LLM-generated Code Evaluation ClassEval: A Manually-Crafted Benchmark for Evaluating LLMs on Class-level Code Generation

Reference 22

Resolution
unresolved
no resolver link, observed 2026-08-07T12:29:18.835891Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T12:29:18.835891Z digest=sha256:aa08f24cefc85d1c3990d6b27b163f24d8a224210578d979bf83ea810c438df5

Observation 0ed1519f-bcdd-4d7b-9da1-022f0af9d30a · outbound

This paper cites CrossCodeEval: A Diverse and Multilingual Benchmark for Cross-File Code Completion.

SwiftEval: Developing a Language-Specific Benchmark for LLM-generated Code Evaluation CrossCodeEval: A Diverse and Multilingual Benchmark for Cross-File Code Completion

Reference 23

Resolution
unresolved
no resolver link, observed 2026-08-07T12:29:18.912346Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T12:29:18.912346Z digest=sha256:58b6e28139ac0d18ede30194049a69ba332e0d1c0cdb7a20ece7949ea4e6bcfa

Observation 3b067938-c473-46de-8d0b-3fae1dd81151 · outbound

This paper cites JavaBench: A Benchmark of Object-Oriented Code Generation for Evaluating Large Language Models.

SwiftEval: Developing a Language-Specific Benchmark for LLM-generated Code Evaluation JavaBench: A Benchmark of Object-Oriented Code Generation for Evaluating Large Language Models

Reference 24

Resolution
verified exact
local_arxiv, observed 2026-08-07T12:29:19.900313Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-08-07T12:29:18.981766Z digest=sha256:57e9a1270ddf864624c41cd33804dcdf72688580929fccbbb041ee2dfe297483

Observation 420e91c7-9ceb-44a7-802d-b81cf01f07ec · outbound

This paper cites mHumanEval -- A Multilingual Benchmark to Evaluate Large Language Models for Code Generation.

SwiftEval: Developing a Language-Specific Benchmark for LLM-generated Code Evaluation mHumanEval -- A Multilingual Benchmark to Evaluate Large Language Models for Code Generation

Reference 25

Resolution
unresolved
no resolver link, observed 2026-08-07T12:29:19.036173Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T12:29:19.036173Z digest=sha256:d4f05ea903f8a1beaf9ab244b4e47cb26051f565ff1733435394243516b64c69

Observation a4d59dc5-d10c-4dec-b44c-3c756e2311f8 · outbound

This paper cites DeepSeek-Coder-V2: Breaking the Barrier of Closed-Source Models in Code Intelligence.

SwiftEval: Developing a Language-Specific Benchmark for LLM-generated Code Evaluation DeepSeek-Coder-V2: Breaking the Barrier of Closed-Source Models in Code Intelligence

Reference 26

Resolution
unresolved
no resolver link, observed 2026-08-07T12:29:19.084876Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T12:29:19.084876Z digest=sha256:2297a4e934da8f805f5cf82a065ffccc0b7e190779082e596900ffa42b10d3f1

Observation 2e236130-4401-4941-b8b7-dd26f15a5daf · outbound

This paper cites Qwen2.5-Coder Technical Report.

SwiftEval: Developing a Language-Specific Benchmark for LLM-generated Code Evaluation Qwen2.5-Coder Technical Report

Reference 27

Resolution
unresolved
no resolver link, observed 2026-08-07T12:29:19.117475Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T12:29:19.117475Z digest=sha256:ff010b51f39de9d051b6b65e5143d1f77d566216ba9622aed989cbbe4145a5ad

Observation 50e71aca-cd44-43f1-b3e0-ee6ecb237f6e · outbound

This paper cites Codestral: Hello, World!,.

SwiftEval: Developing a Language-Specific Benchmark for LLM-generated Code Evaluation Codestral: Hello, World!,

Reference 28

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T12:29:22.594838Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-08-07T12:29:19.175383Z digest=sha256:ba8c23a020ee6ba6f1874600bab38e8fb9c7932c81f024b57bd199e36a64133f

Observation 1cb66ead-1dad-43e4-8f56-ea15961c4df8 · outbound

This paper cites CPP-UT-Bench: Can LLMs Write Complex Unit Tests in C++?.

SwiftEval: Developing a Language-Specific Benchmark for LLM-generated Code Evaluation CPP-UT-Bench: Can LLMs Write Complex Unit Tests in C++?

Reference 29

Resolution
verified exact
local_arxiv, observed 2026-08-07T12:29:19.561417Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-08-07T12:29:19.236375Z digest=sha256:1447708ce50d5b36a16c6f862ed34b6485ae81d097240be8227ee2cc216d9cbd

Observation cc0aa898-2ecb-4237-9d8a-c5a1cccae062 · outbound

This paper cites HumanEval.jl,.

SwiftEval: Developing a Language-Specific Benchmark for LLM-generated Code Evaluation HumanEval.jl,

Reference 30

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T12:29:22.214898Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-08-07T12:29:19.286705Z digest=sha256:7c981f63e46b965274a849a9a531ee8cd96942d2e72ae789b1fed2920ae52380

Observation 4fbff495-e80d-48c8-9c27-092512988089 · outbound

This paper cites Rust Compiling Benchmark,.

SwiftEval: Developing a Language-Specific Benchmark for LLM-generated Code Evaluation Rust Compiling Benchmark,

Reference 31

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T12:29:21.924760Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-08-07T12:29:19.342174Z digest=sha256:294fc96418af0496db84a9db405944a0e49b9cc23126337cd15264354c8cb4aa

Observation 87e2efdb-0046-440d-9965-ce658358a6ec · outbound

This paper cites MultiPL-E: A Scalable and Extensible Approach to Benchmarking Neural Code Generation.

SwiftEval: Developing a Language-Specific Benchmark for LLM-generated Code Evaluation MultiPL-E: A Scalable and Extensible Approach to Benchmarking Neural Code Generation

Reference 2022

Resolution
unresolved
no resolver link, observed 2026-08-07T12:29:17.854881Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T12:29:17.854881Z digest=sha256:2a24ab450a17fd5f8e122b2c8373a2386f01dc8b82865403235c152c874cd2bf

Pith citing papers

No inbound Pith citation observations are available.