{"as_of":"2026-08-10T04:14:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:2be6f7c80e84081e955354b032e0c43be31013d5bb1f8191cb4fae7d043565d5","coverage":[{"denominator":31,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":31,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T12:29:19.342174Z","state":"measured"},{"denominator":31,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":31,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2505.24324/citation-record","integrity":"/paper/2505.24324/integrity","json":"/paper/2505.24324/citation-record.json","paper":"/paper/2505.24324"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2107.03374","last_updated":"2021-07-14T17:16:02Z","snapshot_observed_at":"2026-08-08T11:58:24.516369Z","submitted_at":"2021-07-07T17:41:24Z","title":"Evaluating Large Language Models Trained on Code","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2107.03374","snapshot_observed_at":"2026-08-07T12:29:16.723342Z","title":"Evaluating Large Language Models Trained on Code,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.24324","last_updated":"2025-05-30T08:06:30Z","snapshot_observed_at":"2026-08-08T23:46:24.421775Z","submitted_at":"2025-05-30T08:06:30Z","title":"SwiftEval: Developing a Language-Specific Benchmark for LLM-generated Code Evaluation","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T12:29:16.723342Z"},"links":{"cited_paper":"/paper/2107.03374","citing_paper":"/paper/2505.24324"},"observation_digest":"sha256:721ecd01cee56caa1f14622a5b03f84ef0c5f070e61057177e51bbd700f4ef57","observation_id":"beea5b85-87fa-4e8f-af78-6c00c5c3b812","resolution":{"observed_at":"2026-08-07T12:29:16.723342Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:29:24.635583Z","title":"CodeGen: An Open Large Language Model for Code with Multi-Turn Program Synthesis,","venue":null,"work_id":"db7d52f1-4db2-4686-9e0b-0ac19722a5ec","year":2022},"citing_paper":{"arxiv_id":"2505.24324","last_updated":"2025-05-30T08:06:30Z","snapshot_observed_at":"2026-08-08T23:46:24.421775Z","submitted_at":"2025-05-30T08:06:30Z","title":"SwiftEval: Developing a Language-Specific Benchmark for LLM-generated Code Evaluation","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T12:29:16.771938Z"},"links":{"citing_paper":"/paper/2505.24324"},"observation_digest":"sha256:a67b57eb4a7f9840e7448a2811b9d30973080901e6ddd653781148f71ff117b2","observation_id":"fdfd9c76-f6c0-43a0-b88d-7513e345f0ed","resolution":{"observed_at":"2026-08-07T12:29:24.765437Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2202.13169","last_updated":"2022-05-04T16:08:31Z","snapshot_observed_at":"2026-08-06T20:27:50.671898Z","submitted_at":"2022-02-26T15:53:55Z","title":"A Systematic Evaluation of Large Language Models of Code","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2202.13169","snapshot_observed_at":"2026-08-07T12:29:16.864754Z","title":"A System- atic Evaluation of Large Language Models of Code,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.24324","last_updated":"2025-05-30T08:06:30Z","snapshot_observed_at":"2026-08-08T23:46:24.421775Z","submitted_at":"2025-05-30T08:06:30Z","title":"SwiftEval: Developing a Language-Specific Benchmark for LLM-generated Code Evaluation","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T12:29:16.864754Z"},"links":{"cited_paper":"/paper/2202.13169","citing_paper":"/paper/2505.24324"},"observation_digest":"sha256:924cf04bf65b1384052979c491efbe3ee081451f60ae39e62e6ea082cb9ab051","observation_id":"a7abdd35-4b4e-412e-b899-3b8573467071","resolution":{"observed_at":"2026-08-07T12:29:16.864754Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.14196","last_updated":"2024-01-26T09:23:11Z","snapshot_observed_at":"2026-08-06T22:40:28.707813Z","submitted_at":"2024-01-25T14:17:53Z","title":"DeepSeek-Coder: When the Large Language Model Meets Programming -- The Rise of Code Intelligence","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.14196","snapshot_observed_at":"2026-08-07T12:29:17.012603Z","title":"DeepSeek-Coder: When the Large Language Model Meets Programming – The Rise of Code Intelligence,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24324","last_updated":"2025-05-30T08:06:30Z","snapshot_observed_at":"2026-08-08T23:46:24.421775Z","submitted_at":"2025-05-30T08:06:30Z","title":"SwiftEval: Developing a Language-Specific Benchmark for LLM-generated Code Evaluation","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T12:29:17.012603Z"},"links":{"cited_paper":"/paper/2401.14196","citing_paper":"/paper/2505.24324"},"observation_digest":"sha256:5744a7a9b10cf23d64774de0e93d3401cd22dc749127348eb34388e5b36630ed","observation_id":"c225c370-6ffa-4b0f-ac48-1692011462c6","resolution":{"observed_at":"2026-08-07T12:29:17.012603Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:29:24.404748Z","title":"Code Llama: Open Foundation Models for Code,","venue":null,"work_id":"b5c66e54-36ec-45eb-9767-7e6e78b3b853","year":null},"citing_paper":{"arxiv_id":"2505.24324","last_updated":"2025-05-30T08:06:30Z","snapshot_observed_at":"2026-08-08T23:46:24.421775Z","submitted_at":"2025-05-30T08:06:30Z","title":"SwiftEval: Developing a Language-Specific Benchmark for LLM-generated Code Evaluation","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T12:29:17.072363Z"},"links":{"citing_paper":"/paper/2505.24324"},"observation_digest":"sha256:08afe88bf021c75b385d0eca1841951e1bb04b2b8e122348303b9cd128970235","observation_id":"179b10cf-8abc-4b9c-b004-bbf94ff66f0c","resolution":{"observed_at":"2026-08-07T12:29:24.516278Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:29:24.143513Z","title":"Code Completion by Modeling Flattened Abstract Syntax Trees as Graphs,","venue":null,"work_id":"473ca4bb-7e27-4631-82c7-31d93ffeb961","year":2021},"citing_paper":{"arxiv_id":"2505.24324","last_updated":"2025-05-30T08:06:30Z","snapshot_observed_at":"2026-08-08T23:46:24.421775Z","submitted_at":"2025-05-30T08:06:30Z","title":"SwiftEval: Developing a Language-Specific Benchmark for LLM-generated Code Evaluation","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T12:29:17.100223Z"},"links":{"citing_paper":"/paper/2505.24324"},"observation_digest":"sha256:655e21c57126f9039f6811492fb70242f75b0e917e1f18ec85ff2cb51adc3046","observation_id":"e80f189a-dbe1-49ed-aeab-78742db7615c","resolution":{"observed_at":"2026-08-07T12:29:24.238411Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:29:23.885084Z","title":"Lost in Translation: A Study of Bugs Introduced by Large Language Models while Translating Code,","venue":null,"work_id":"16be09c3-84be-4e4b-9b33-6e00eddf8594","year":2024},"citing_paper":{"arxiv_id":"2505.24324","last_updated":"2025-05-30T08:06:30Z","snapshot_observed_at":"2026-08-08T23:46:24.421775Z","submitted_at":"2025-05-30T08:06:30Z","title":"SwiftEval: Developing a Language-Specific Benchmark for LLM-generated Code Evaluation","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T12:29:17.154474Z"},"links":{"citing_paper":"/paper/2505.24324"},"observation_digest":"sha256:6e8fccc53758abe8af07c85cae03284fa99e97f6179062cd9fa68adcc1418358","observation_id":"993299aa-b9fc-4646-bcbb-4c01309223e5","resolution":{"observed_at":"2026-08-07T12:29:24.005177Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2207.04237","last_updated":"2022-09-08T06:50:16Z","snapshot_observed_at":"2026-08-09T12:19:07.109327Z","submitted_at":"2022-07-09T09:57:11Z","title":"Few-shot training LLMs for project-specific code-summarization","version":2},"cited_work":{"arxiv_id":"2207.04237","doi":null,"metadata_source":"pith","pith_arxiv_id":"2207.04237","snapshot_observed_at":"2026-08-07T12:29:21.103852Z","title":"Few-shot training LLMs for project-specific code-summarization","venue":"cs.SE","work_id":"d8b6c46c-d4b5-434e-91e8-7026c8b19737","year":2022},"citing_paper":{"arxiv_id":"2505.24324","last_updated":"2025-05-30T08:06:30Z","snapshot_observed_at":"2026-08-08T23:46:24.421775Z","submitted_at":"2025-05-30T08:06:30Z","title":"SwiftEval: Developing a Language-Specific Benchmark for LLM-generated Code Evaluation","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T12:29:17.205650Z"},"links":{"cited_paper":"/paper/2207.04237","citing_paper":"/paper/2505.24324"},"observation_digest":"sha256:a7360ef8f2738648ffccdfc6d853f326fbd8bee9954921fa0632d067e702db2f","observation_id":"f2b866d3-1975-437f-bd25-af74eacae51b","resolution":{"observed_at":"2026-08-07T12:29:21.221743Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2108.07732","last_updated":"2021-08-16T03:57:30Z","snapshot_observed_at":"2026-08-02T19:23:53.535075Z","submitted_at":"2021-08-16T03:57:30Z","title":"Program Synthesis with Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2108.07732","snapshot_observed_at":"2026-08-07T12:29:17.258721Z","title":"Program Synthesis with Large Language Models,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.24324","last_updated":"2025-05-30T08:06:30Z","snapshot_observed_at":"2026-08-08T23:46:24.421775Z","submitted_at":"2025-05-30T08:06:30Z","title":"SwiftEval: Developing a Language-Specific Benchmark for LLM-generated Code Evaluation","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T12:29:17.258721Z"},"links":{"cited_paper":"/paper/2108.07732","citing_paper":"/paper/2505.24324"},"observation_digest":"sha256:c256a4f8df230f8e1b831db852a1c1cccb7c18ad6f87c444af39b8f3bdc665ea","observation_id":"187c8295-2312-4503-9d86-e9a619655250","resolution":{"observed_at":"2026-08-07T12:29:17.258721Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:29:23.681671Z","title":"Multi-lingual Evaluation of Code Generation Models,","venue":null,"work_id":"16544719-3fde-418a-aff7-49e9cf5a52f1","year":null},"citing_paper":{"arxiv_id":"2505.24324","last_updated":"2025-05-30T08:06:30Z","snapshot_observed_at":"2026-08-08T23:46:24.421775Z","submitted_at":"2025-05-30T08:06:30Z","title":"SwiftEval: Developing a Language-Specific Benchmark for LLM-generated Code Evaluation","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T12:29:17.357832Z"},"links":{"citing_paper":"/paper/2505.24324"},"observation_digest":"sha256:f4664f454f10780b8af807f467c0b4787eaab8f5f1b3719c3d70775e8d6defcf","observation_id":"1ee8ea2e-ba01-48dd-b29d-1ce5a23110e6","resolution":{"observed_at":"2026-08-07T12:29:23.771090Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.09420","last_updated":"2023-05-08T10:25:41Z","snapshot_observed_at":"2026-08-08T23:45:28.042958Z","submitted_at":"2022-12-19T12:55:32Z","title":"Large Language Models Meet NL2Code: A Survey","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.09420","snapshot_observed_at":"2026-08-07T12:29:17.440179Z","title":"Large Language Models Meet NL2Code: A Survey,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.24324","last_updated":"2025-05-30T08:06:30Z","snapshot_observed_at":"2026-08-08T23:46:24.421775Z","submitted_at":"2025-05-30T08:06:30Z","title":"SwiftEval: Developing a Language-Specific Benchmark for LLM-generated Code Evaluation","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T12:29:17.440179Z"},"links":{"cited_paper":"/paper/2212.09420","citing_paper":"/paper/2505.24324"},"observation_digest":"sha256:907c5ba9937a25a82f46fbff2b4ccd4e689affb76b1dd35ad840e6233c7af8a3","observation_id":"4e8e84b3-d10f-49f2-b574-4d8f8eaf4e04","resolution":{"observed_at":"2026-08-07T12:29:17.440179Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2105.09938","last_updated":"2021-11-08T21:16:44Z","snapshot_observed_at":"2026-08-04T23:13:25.514661Z","submitted_at":"2021-05-20T17:58:42Z","title":"Measuring Coding Challenge Competence With APPS","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2105.09938","snapshot_observed_at":"2026-08-07T12:29:17.540016Z","title":"Measuring Coding Challenge Competence With APPS,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.24324","last_updated":"2025-05-30T08:06:30Z","snapshot_observed_at":"2026-08-08T23:46:24.421775Z","submitted_at":"2025-05-30T08:06:30Z","title":"SwiftEval: Developing a Language-Specific Benchmark for LLM-generated Code Evaluation","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T12:29:17.540016Z"},"links":{"cited_paper":"/paper/2105.09938","citing_paper":"/paper/2505.24324"},"observation_digest":"sha256:3e9e8238b0487831e76ccd1623c2550c30fdcc3d92281c630d5254dfc21982fe","observation_id":"ba0c226f-54b7-4ea7-9d9a-fd90facb5e6b","resolution":{"observed_at":"2026-08-07T12:29:17.540016Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.13474","last_updated":"2023-02-27T21:26:48Z","snapshot_observed_at":"2026-07-06T12:52:16.992962Z","submitted_at":"2022-03-25T06:55:15Z","title":"CodeGen: An Open Large Language Model for Code with Multi-Turn Program Synthesis","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.13474","snapshot_observed_at":"2026-08-07T12:29:17.628104Z","title":"CodeGen: An Open Large Language Model for Code with Multi-Turn Program Synthesis,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.24324","last_updated":"2025-05-30T08:06:30Z","snapshot_observed_at":"2026-08-08T23:46:24.421775Z","submitted_at":"2025-05-30T08:06:30Z","title":"SwiftEval: Developing a Language-Specific Benchmark for LLM-generated Code Evaluation","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T12:29:17.628104Z"},"links":{"cited_paper":"/paper/2203.13474","citing_paper":"/paper/2505.24324"},"observation_digest":"sha256:321e94ec916eabc55237397f74dd1f5bcbb8d4f377d3fa9ee76d50933e1257a1","observation_id":"fcc5be15-61c6-4ab8-9267-2194bece6ba9","resolution":{"observed_at":"2026-08-07T12:29:17.628104Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:29:23.445307Z","title":"MultiPL-E: A Scalable and Extensible Approach to Benchmarking Neural Code Generation,","venue":null,"work_id":"36cadb6e-8a7e-47ac-bed9-b66a51e5e42e","year":null},"citing_paper":{"arxiv_id":"2505.24324","last_updated":"2025-05-30T08:06:30Z","snapshot_observed_at":"2026-08-08T23:46:24.421775Z","submitted_at":"2025-05-30T08:06:30Z","title":"SwiftEval: Developing a Language-Specific Benchmark for LLM-generated Code Evaluation","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T12:29:17.720704Z"},"links":{"citing_paper":"/paper/2505.24324"},"observation_digest":"sha256:875ab07045d3457c5b99739ffc52744239adeff018509c3e080ede6083936455","observation_id":"b966ab95-d45a-4334-a0b9-ba15c86ccff5","resolution":{"observed_at":"2026-08-07T12:29:23.566218Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.16694","last_updated":"2024-03-24T15:41:21Z","snapshot_observed_at":"2026-08-03T09:29:36.187988Z","submitted_at":"2024-02-26T16:09:00Z","title":"HumanEval-XL: A Multilingual Code Generation Benchmark for Cross-lingual Natural Language Generalization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.16694","snapshot_observed_at":"2026-08-07T12:29:17.936773Z","title":"HumanEval-XL: A Multilingual Code Generation Benchmark for Cross-lingual Natural Language Generaliza- tion,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24324","last_updated":"2025-05-30T08:06:30Z","snapshot_observed_at":"2026-08-08T23:46:24.421775Z","submitted_at":"2025-05-30T08:06:30Z","title":"SwiftEval: Developing a Language-Specific Benchmark for LLM-generated Code Evaluation","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T12:29:17.936773Z"},"links":{"cited_paper":"/paper/2402.16694","citing_paper":"/paper/2505.24324"},"observation_digest":"sha256:087bf874856536e5622bbbbfc53fc313637b86ee2e7f05cc684d94250dfbb4ee","observation_id":"08259e35-cb6d-4722-9b32-b986b9a79b8e","resolution":{"observed_at":"2026-08-07T12:29:17.936773Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:29:23.073714Z","title":"The RedMonk Programming Language Rankings: June 2024,","venue":null,"work_id":"a1338a7a-d3e4-4d7f-906a-f03e45c38bf7","year":2024},"citing_paper":{"arxiv_id":"2505.24324","last_updated":"2025-05-30T08:06:30Z","snapshot_observed_at":"2026-08-08T23:46:24.421775Z","submitted_at":"2025-05-30T08:06:30Z","title":"SwiftEval: Developing a Language-Specific Benchmark for LLM-generated Code Evaluation","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T12:29:18.074472Z"},"links":{"citing_paper":"/paper/2505.24324"},"observation_digest":"sha256:f369d4205d61155dfb59e5ee1eab9e6059f43108a93b823a4fdfb5993a9a1b69","observation_id":"28ff50ae-dac9-4b29-ad6e-4aa66b623c37","resolution":{"observed_at":"2026-08-07T12:29:23.204754Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:29:22.814772Z","title":"BLEU: a method for automatic evaluation of machine translation,","venue":null,"work_id":"0aa239ea-77f4-404e-adf0-480753e6c863","year":2001},"citing_paper":{"arxiv_id":"2505.24324","last_updated":"2025-05-30T08:06:30Z","snapshot_observed_at":"2026-08-08T23:46:24.421775Z","submitted_at":"2025-05-30T08:06:30Z","title":"SwiftEval: Developing a Language-Specific Benchmark for LLM-generated Code Evaluation","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T12:29:18.185855Z"},"links":{"citing_paper":"/paper/2505.24324"},"observation_digest":"sha256:be03610bf7085e80fe7722f661ee3be26cc304ee482c7ce634d1ac82d4c03808","observation_id":"17e14ba7-40c0-475d-9163-b51da64b5e20","resolution":{"observed_at":"2026-08-07T12:29:22.910899Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2009.10297","last_updated":"2020-09-27T04:07:11Z","snapshot_observed_at":"2026-08-01T07:33:26.380394Z","submitted_at":"2020-09-22T03:10:49Z","title":"CodeBLEU: a Method for Automatic Evaluation of Code Synthesis","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2009.10297","snapshot_observed_at":"2026-08-07T12:29:18.364837Z","title":"CodeBLEU: a Method for Automatic Evaluation of Code Synthesis,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.24324","last_updated":"2025-05-30T08:06:30Z","snapshot_observed_at":"2026-08-08T23:46:24.421775Z","submitted_at":"2025-05-30T08:06:30Z","title":"SwiftEval: Developing a Language-Specific Benchmark for LLM-generated Code Evaluation","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T12:29:18.364837Z"},"links":{"cited_paper":"/paper/2009.10297","citing_paper":"/paper/2505.24324"},"observation_digest":"sha256:c088723476e9a017d5ad8b566328daed00b373c29c8533cba85348375f5b1f9f","observation_id":"889cb942-2ff9-4f1b-844a-d6d684838f2d","resolution":{"observed_at":"2026-08-07T12:29:18.364837Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.04850","last_updated":"2023-11-11T05:11:18Z","snapshot_observed_at":"2026-08-07T11:21:12.881808Z","submitted_at":"2023-11-08T17:35:20Z","title":"Rethinking Benchmark and Contamination for Language Models with Rephrased Samples","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.04850","snapshot_observed_at":"2026-08-07T12:29:18.525978Z","title":"Rethinking Benchmark and Contamination for Language Models with Rephrased Samples,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.24324","last_updated":"2025-05-30T08:06:30Z","snapshot_observed_at":"2026-08-08T23:46:24.421775Z","submitted_at":"2025-05-30T08:06:30Z","title":"SwiftEval: Developing a Language-Specific Benchmark for LLM-generated Code Evaluation","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T12:29:18.525978Z"},"links":{"cited_paper":"/paper/2311.04850","citing_paper":"/paper/2505.24324"},"observation_digest":"sha256:45845cdbd096c0f51c412856f84799d97b9b31a386eb4e52e90574cabe8ae93a","observation_id":"fb1ad3e0-5e03-4ab1-aeff-d7c4f5f9f56d","resolution":{"observed_at":"2026-08-07T12:29:18.525978Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.11501","last_updated":"2022-11-18T17:20:27Z","snapshot_observed_at":"2026-08-09T13:53:26.987097Z","submitted_at":"2022-11-18T17:20:27Z","title":"DS-1000: A Natural and Reliable Benchmark for Data Science Code Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.11501","snapshot_observed_at":"2026-08-07T12:29:18.701253Z","title":"DS-1000: A Natural and Reliable Benchmark for Data Science Code Generation,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.24324","last_updated":"2025-05-30T08:06:30Z","snapshot_observed_at":"2026-08-08T23:46:24.421775Z","submitted_at":"2025-05-30T08:06:30Z","title":"SwiftEval: Developing a Language-Specific Benchmark for LLM-generated Code Evaluation","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T12:29:18.701253Z"},"links":{"cited_paper":"/paper/2211.11501","citing_paper":"/paper/2505.24324"},"observation_digest":"sha256:ace0b07cb42b575799524a2c2e287d440bc27bab3522368dbe8159cd80936bce","observation_id":"e5e5128d-a80f-418b-8437-e1711082ceea","resolution":{"observed_at":"2026-08-07T12:29:18.701253Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.01861","last_updated":"2023-08-14T09:07:00Z","snapshot_observed_at":"2026-08-03T22:16:12.497107Z","submitted_at":"2023-08-03T16:31:02Z","title":"ClassEval: A Manually-Crafted Benchmark for Evaluating LLMs on Class-level Code Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.01861","snapshot_observed_at":"2026-08-07T12:29:18.835891Z","title":"ClassEval: A Manually-Crafted Benchmark for Evaluating LLMs on Class-level Code Generation,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.24324","last_updated":"2025-05-30T08:06:30Z","snapshot_observed_at":"2026-08-08T23:46:24.421775Z","submitted_at":"2025-05-30T08:06:30Z","title":"SwiftEval: Developing a Language-Specific Benchmark for LLM-generated Code Evaluation","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T12:29:18.835891Z"},"links":{"cited_paper":"/paper/2308.01861","citing_paper":"/paper/2505.24324"},"observation_digest":"sha256:aa08f24cefc85d1c3990d6b27b163f24d8a224210578d979bf83ea810c438df5","observation_id":"a067a680-2594-451c-a942-61d846b27d0d","resolution":{"observed_at":"2026-08-07T12:29:18.835891Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.11248","last_updated":"2023-11-17T02:51:39Z","snapshot_observed_at":"2026-07-06T16:34:31.299748Z","submitted_at":"2023-10-17T13:18:01Z","title":"CrossCodeEval: A Diverse and Multilingual Benchmark for Cross-File Code Completion","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.11248","snapshot_observed_at":"2026-08-07T12:29:18.912346Z","title":"Cross- CodeEval: A Diverse and Multilingual Benchmark for Cross-File Code Completion,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.24324","last_updated":"2025-05-30T08:06:30Z","snapshot_observed_at":"2026-08-08T23:46:24.421775Z","submitted_at":"2025-05-30T08:06:30Z","title":"SwiftEval: Developing a Language-Specific Benchmark for LLM-generated Code Evaluation","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T12:29:18.912346Z"},"links":{"cited_paper":"/paper/2310.11248","citing_paper":"/paper/2505.24324"},"observation_digest":"sha256:58b6e28139ac0d18ede30194049a69ba332e0d1c0cdb7a20ece7949ea4e6bcfa","observation_id":"0ed1519f-bcdd-4d7b-9da1-022f0af9d30a","resolution":{"observed_at":"2026-08-07T12:29:18.912346Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.12902","last_updated":"2024-10-11T10:27:16Z","snapshot_observed_at":"2026-07-06T18:33:11.370375Z","submitted_at":"2024-06-10T06:43:25Z","title":"JavaBench: A Benchmark of Object-Oriented Code Generation for Evaluating Large Language Models","version":2},"cited_work":{"arxiv_id":"2406.12902","doi":null,"metadata_source":"pith","pith_arxiv_id":"2406.12902","snapshot_observed_at":"2026-08-07T12:29:19.838865Z","title":"JavaBench: A Benchmark of Object-Oriented Code Generation for Evaluating Large Language Models","venue":"cs.LG","work_id":"11b0e4c5-3f10-439c-bf2a-594a5331604c","year":2024},"citing_paper":{"arxiv_id":"2505.24324","last_updated":"2025-05-30T08:06:30Z","snapshot_observed_at":"2026-08-08T23:46:24.421775Z","submitted_at":"2025-05-30T08:06:30Z","title":"SwiftEval: Developing a Language-Specific Benchmark for LLM-generated Code Evaluation","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T12:29:18.981766Z"},"links":{"cited_paper":"/paper/2406.12902","citing_paper":"/paper/2505.24324"},"observation_digest":"sha256:57e9a1270ddf864624c41cd33804dcdf72688580929fccbbb041ee2dfe297483","observation_id":"3b067938-c473-46de-8d0b-3fae1dd81151","resolution":{"observed_at":"2026-08-07T12:29:19.900313Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.15037","last_updated":"2025-01-26T00:56:43Z","snapshot_observed_at":"2026-08-05T15:39:57.235988Z","submitted_at":"2024-10-19T08:44:26Z","title":"mHumanEval -- A Multilingual Benchmark to Evaluate Large Language Models for Code Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.15037","snapshot_observed_at":"2026-08-07T12:29:19.036173Z","title":"mHumanEval – A Multilingual Benchmark to Evaluate Large Language Models for Code Generation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24324","last_updated":"2025-05-30T08:06:30Z","snapshot_observed_at":"2026-08-08T23:46:24.421775Z","submitted_at":"2025-05-30T08:06:30Z","title":"SwiftEval: Developing a Language-Specific Benchmark for LLM-generated Code Evaluation","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T12:29:19.036173Z"},"links":{"cited_paper":"/paper/2410.15037","citing_paper":"/paper/2505.24324"},"observation_digest":"sha256:d4f05ea903f8a1beaf9ab244b4e47cb26051f565ff1733435394243516b64c69","observation_id":"420e91c7-9ceb-44a7-802d-b81cf01f07ec","resolution":{"observed_at":"2026-08-07T12:29:19.036173Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11931","last_updated":"2024-06-17T13:51:35Z","snapshot_observed_at":"2026-08-07T06:30:25.302107Z","submitted_at":"2024-06-17T13:51:35Z","title":"DeepSeek-Coder-V2: Breaking the Barrier of Closed-Source Models in Code Intelligence","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.11931","snapshot_observed_at":"2026-08-07T12:29:19.084876Z","title":"DeepSeek-Coder-V2: Breaking the Barrier of Closed-Source Models in Code Intelligence,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24324","last_updated":"2025-05-30T08:06:30Z","snapshot_observed_at":"2026-08-08T23:46:24.421775Z","submitted_at":"2025-05-30T08:06:30Z","title":"SwiftEval: Developing a Language-Specific Benchmark for LLM-generated Code Evaluation","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T12:29:19.084876Z"},"links":{"cited_paper":"/paper/2406.11931","citing_paper":"/paper/2505.24324"},"observation_digest":"sha256:2297a4e934da8f805f5cf82a065ffccc0b7e190779082e596900ffa42b10d3f1","observation_id":"a4d59dc5-d10c-4dec-b44c-3c756e2311f8","resolution":{"observed_at":"2026-08-07T12:29:19.084876Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12186","last_updated":"2024-11-12T13:24:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-18T17:57:57Z","title":"Qwen2.5-Coder Technical Report","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12186","snapshot_observed_at":"2026-08-07T12:29:19.117475Z","title":"Qwen2.5-Coder Technical Report,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24324","last_updated":"2025-05-30T08:06:30Z","snapshot_observed_at":"2026-08-08T23:46:24.421775Z","submitted_at":"2025-05-30T08:06:30Z","title":"SwiftEval: Developing a Language-Specific Benchmark for LLM-generated Code Evaluation","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T12:29:19.117475Z"},"links":{"cited_paper":"/paper/2409.12186","citing_paper":"/paper/2505.24324"},"observation_digest":"sha256:ff010b51f39de9d051b6b65e5143d1f77d566216ba9622aed989cbbe4145a5ad","observation_id":"2e236130-4401-4941-b8b7-dd26f15a5daf","resolution":{"observed_at":"2026-08-07T12:29:19.117475Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:29:22.404815Z","title":"Codestral: Hello, World!,","venue":null,"work_id":"1753495e-e34a-40dd-9ca8-3ba823237181","year":2024},"citing_paper":{"arxiv_id":"2505.24324","last_updated":"2025-05-30T08:06:30Z","snapshot_observed_at":"2026-08-08T23:46:24.421775Z","submitted_at":"2025-05-30T08:06:30Z","title":"SwiftEval: Developing a Language-Specific Benchmark for LLM-generated Code Evaluation","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T12:29:19.175383Z"},"links":{"citing_paper":"/paper/2505.24324"},"observation_digest":"sha256:ba8c23a020ee6ba6f1874600bab38e8fb9c7932c81f024b57bd199e36a64133f","observation_id":"50e71aca-cd44-43f1-b3e0-ee6ecb237f6e","resolution":{"observed_at":"2026-08-07T12:29:22.594838Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.02735","last_updated":"2024-12-03T18:35:24Z","snapshot_observed_at":"2026-08-09T17:44:18.259900Z","submitted_at":"2024-12-03T18:35:24Z","title":"CPP-UT-Bench: Can LLMs Write Complex Unit Tests in C++?","version":1},"cited_work":{"arxiv_id":"2412.02735","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.02735","snapshot_observed_at":"2026-08-07T12:29:19.468767Z","title":"CPP-UT-Bench: Can LLMs Write Complex Unit Tests in C++?","venue":"cs.SE","work_id":"c9e863e4-4493-4c2e-b75b-b6efa96f091b","year":2024},"citing_paper":{"arxiv_id":"2505.24324","last_updated":"2025-05-30T08:06:30Z","snapshot_observed_at":"2026-08-08T23:46:24.421775Z","submitted_at":"2025-05-30T08:06:30Z","title":"SwiftEval: Developing a Language-Specific Benchmark for LLM-generated Code Evaluation","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T12:29:19.236375Z"},"links":{"cited_paper":"/paper/2412.02735","citing_paper":"/paper/2505.24324"},"observation_digest":"sha256:1447708ce50d5b36a16c6f862ed34b6485ae81d097240be8227ee2cc216d9cbd","observation_id":"1cb66ead-1dad-43e4-8f56-ea15961c4df8","resolution":{"observed_at":"2026-08-07T12:29:19.561417Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:29:22.084313Z","title":"HumanEval.jl,","venue":null,"work_id":"111ad8af-8e33-4ec0-a5fa-d4c6dc638668","year":2024},"citing_paper":{"arxiv_id":"2505.24324","last_updated":"2025-05-30T08:06:30Z","snapshot_observed_at":"2026-08-08T23:46:24.421775Z","submitted_at":"2025-05-30T08:06:30Z","title":"SwiftEval: Developing a Language-Specific Benchmark for LLM-generated Code Evaluation","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T12:29:19.286705Z"},"links":{"citing_paper":"/paper/2505.24324"},"observation_digest":"sha256:7c981f63e46b965274a849a9a531ee8cd96942d2e72ae789b1fed2920ae52380","observation_id":"cc0aa898-2ecb-4237-9d8a-c5a1cccae062","resolution":{"observed_at":"2026-08-07T12:29:22.214898Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:29:21.764536Z","title":"Rust Compiling Benchmark,","venue":null,"work_id":"67ecfe1d-87c3-4158-84f0-eea27874073e","year":2024},"citing_paper":{"arxiv_id":"2505.24324","last_updated":"2025-05-30T08:06:30Z","snapshot_observed_at":"2026-08-08T23:46:24.421775Z","submitted_at":"2025-05-30T08:06:30Z","title":"SwiftEval: Developing a Language-Specific Benchmark for LLM-generated Code Evaluation","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T12:29:19.342174Z"},"links":{"citing_paper":"/paper/2505.24324"},"observation_digest":"sha256:294fc96418af0496db84a9db405944a0e49b9cc23126337cd15264354c8cb4aa","observation_id":"4fbff495-e80d-48c8-9c27-092512988089","resolution":{"observed_at":"2026-08-07T12:29:21.924760Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2208.08227","last_updated":"2022-12-19T10:30:12Z","snapshot_observed_at":"2026-08-09T09:48:07.734660Z","submitted_at":"2022-08-17T11:16:52Z","title":"MultiPL-E: A Scalable and Extensible Approach to Benchmarking Neural Code Generation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2208.08227","snapshot_observed_at":"2026-08-07T12:29:17.854881Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.24324","last_updated":"2025-05-30T08:06:30Z","snapshot_observed_at":"2026-08-08T23:46:24.421775Z","submitted_at":"2025-05-30T08:06:30Z","title":"SwiftEval: Developing a Language-Specific Benchmark for LLM-generated Code Evaluation","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-07T12:29:17.854881Z"},"links":{"cited_paper":"/paper/2208.08227","citing_paper":"/paper/2505.24324"},"observation_digest":"sha256:2a24ab450a17fd5f8e122b2c8373a2386f01dc8b82865403235c152c874cd2bf","observation_id":"87e2efdb-0046-440d-9965-ce658358a6ec","resolution":{"observed_at":"2026-08-07T12:29:17.854881Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2505.24324","last_updated":"2025-05-30T08:06:30Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-08T23:46:24.421775Z","submitted_at":"2025-05-30T08:06:30Z","title":"SwiftEval: Developing a Language-Specific Benchmark for LLM-generated Code Evaluation"},"reference_resolution":{"displayed":31,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":17,"verified_exact":3,"verified_fuzzy":11},"total_outbound_references":31},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 31 of 31 outbound references and 0 inbound Pith citation observations for arXiv:2505.24324."}