{"as_of":"2026-08-11T14:32:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:ee9baa916fb638542d79aac27bf1d902407a97943fe62f520c33b2a3ac2c408d","coverage":[{"denominator":46,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":46,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T14:18:49.895278Z","state":"measured"},{"denominator":47,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":47,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-11T06:34:44.6726+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T17:32:33.789468Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-06T17:32:34.591005Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.19502","last_updated":"2025-05-26T04:29:14Z","snapshot_observed_at":"2026-08-08T05:31:17.095413Z","submitted_at":"2025-05-26T04:29:14Z","title":"CODE-DITING: A Reasoning-Based Metric for Functional Alignment in Code Evaluation","version":1},"cited_work":{"arxiv_id":"2505.19502","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.19502","snapshot_observed_at":"2026-08-06T17:32:34.591005Z","title":"CODE-DITING: A Reasoning-Based Metric for Functional Alignment in Code Evaluation","venue":"cs.SE","work_id":"761a9802-1014-408b-ae6d-a7bd93131e61","year":2025},"citing_paper":{"arxiv_id":"2507.10535","last_updated":"2025-08-14T17:58:50Z","snapshot_observed_at":"2026-08-09T16:40:01.179500Z","submitted_at":"2025-07-14T17:56:29Z","title":"CodeJudgeBench: Benchmarking LLM-as-a-Judge for Coding Tasks","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-06T17:32:33.789468Z"},"links":{"cited_paper":"/paper/2505.19502","citing_paper":"/paper/2507.10535"},"observation_digest":"sha256:397091b8eba116557ee12d6b66d0b7508f2927eb3626b903466c3424e29c6646","observation_id":"3578691e-6982-4de8-8a26-b88ee4ce7fbf","resolution":{"observed_at":"2026-08-06T17:32:34.645100Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2505.19502/citation-record","integrity":"/paper/2505.19502/integrity","json":"/paper/2505.19502/citation-record.json","paper":"/paper/2505.19502"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:18:43.793868Z","title":"Llm-based multi-agent systems for software engineering: Literature review, vision and the road ahead,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19502","last_updated":"2025-05-26T04:29:14Z","snapshot_observed_at":"2026-08-08T05:31:17.095413Z","submitted_at":"2025-05-26T04:29:14Z","title":"CODE-DITING: A Reasoning-Based Metric for Functional Alignment in Code Evaluation","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T14:18:43.793868Z"},"links":{"citing_paper":"/paper/2505.19502"},"observation_digest":"sha256:4df47cd4294e3aadebd4089fa8881abde25d9b7ad51e47c64002a8caa43ab29d","observation_id":"c8c3daba-9935-4ca6-9220-153383d74bfc","resolution":{"observed_at":"2026-08-07T14:18:43.793868Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:18:43.852067Z","title":"Efficient and green large language models for software engineering: Vision and the road ahead,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19502","last_updated":"2025-05-26T04:29:14Z","snapshot_observed_at":"2026-08-08T05:31:17.095413Z","submitted_at":"2025-05-26T04:29:14Z","title":"CODE-DITING: A Reasoning-Based Metric for Functional Alignment in Code Evaluation","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T14:18:43.852067Z"},"links":{"citing_paper":"/paper/2505.19502"},"observation_digest":"sha256:fac32f72a635743fddb390129d8a42b5e48d49b86e6f5cf9eb72faea5c854037","observation_id":"37ac8ab1-e125-492e-a656-74e769683d7f","resolution":{"observed_at":"2026-08-07T14:18:43.852067Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:18:43.977776Z","title":"Large language models for software engi- neering: A systematic literature review,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19502","last_updated":"2025-05-26T04:29:14Z","snapshot_observed_at":"2026-08-08T05:31:17.095413Z","submitted_at":"2025-05-26T04:29:14Z","title":"CODE-DITING: A Reasoning-Based Metric for Functional Alignment in Code Evaluation","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T14:18:43.977776Z"},"links":{"citing_paper":"/paper/2505.19502"},"observation_digest":"sha256:b8672abfa9cbeaafc0a56c53b593219d61eb41bd7c77c40971b66fcb2d09a9ef","observation_id":"7059d352-e049-4c97-b5ff-c4b3d8c384a3","resolution":{"observed_at":"2026-08-07T14:18:43.977776Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:18:55.977575Z","title":"Exploring the capabilities of llms for code change related tasks,","venue":null,"work_id":"bab668f1-78d3-47b3-9aaa-fa7f352cf76e","year":2024},"citing_paper":{"arxiv_id":"2505.19502","last_updated":"2025-05-26T04:29:14Z","snapshot_observed_at":"2026-08-08T05:31:17.095413Z","submitted_at":"2025-05-26T04:29:14Z","title":"CODE-DITING: A Reasoning-Based Metric for Functional Alignment in Code Evaluation","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T14:18:44.075982Z"},"links":{"citing_paper":"/paper/2505.19502"},"observation_digest":"sha256:294c28967900afab54baaacd7eb29727b5474249cdd68ff59b0544780768ca6b","observation_id":"d5db457a-4915-4066-a1b2-91a769ee34f4","resolution":{"observed_at":"2026-08-07T14:18:56.142825Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:18:44.190067Z","title":"Chain- of-thought in neural code generation: From and for lightweight language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19502","last_updated":"2025-05-26T04:29:14Z","snapshot_observed_at":"2026-08-08T05:31:17.095413Z","submitted_at":"2025-05-26T04:29:14Z","title":"CODE-DITING: A Reasoning-Based Metric for Functional Alignment in Code Evaluation","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T14:18:44.190067Z"},"links":{"citing_paper":"/paper/2505.19502"},"observation_digest":"sha256:95c3ef4e253e8a194840c17ee1dfeea2b29d9224a716f5f84e31e1918c54a2f2","observation_id":"436ddac7-8fc6-453a-bd73-f5cb6ff0165b","resolution":{"observed_at":"2026-08-07T14:18:44.190067Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:18:44.323662Z","title":"An empirical study of retrieval-augmented code generation: Challenges and opportunities,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.19502","last_updated":"2025-05-26T04:29:14Z","snapshot_observed_at":"2026-08-08T05:31:17.095413Z","submitted_at":"2025-05-26T04:29:14Z","title":"CODE-DITING: A Reasoning-Based Metric for Functional Alignment in Code Evaluation","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T14:18:44.323662Z"},"links":{"citing_paper":"/paper/2505.19502"},"observation_digest":"sha256:808202a888b40b16bf5119727b14265623d1d3f895ef1ef044f7dd704e260cf3","observation_id":"edc0ac39-d979-410b-899e-af50a5ee8016","resolution":{"observed_at":"2026-08-07T14:18:44.323662Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:18:44.419952Z","title":"A review on code generation with llms: Application and evaluation,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.19502","last_updated":"2025-05-26T04:29:14Z","snapshot_observed_at":"2026-08-08T05:31:17.095413Z","submitted_at":"2025-05-26T04:29:14Z","title":"CODE-DITING: A Reasoning-Based Metric for Functional Alignment in Code Evaluation","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T14:18:44.419952Z"},"links":{"citing_paper":"/paper/2505.19502"},"observation_digest":"sha256:10b215a84efa39adcb7d11b3dd34361aa0064e7d23ca5f88609796f257fbad9f","observation_id":"b8e62aa2-67fc-4b4c-8ff7-ee8e4befcdde","resolution":{"observed_at":"2026-08-07T14:18:44.419952Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.06918","last_updated":"2025-03-18T04:58:23Z","snapshot_observed_at":"2026-07-06T18:28:38.016649Z","submitted_at":"2024-06-11T03:19:18Z","title":"HumanEvo: An Evolution-aware Benchmark for More Realistic Evaluation of Repository-level Code Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.06918","snapshot_observed_at":"2026-08-07T14:18:44.535532Z","title":"Towards more realistic evaluation of llm-based code generation: an experimental study and beyond,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19502","last_updated":"2025-05-26T04:29:14Z","snapshot_observed_at":"2026-08-08T05:31:17.095413Z","submitted_at":"2025-05-26T04:29:14Z","title":"CODE-DITING: A Reasoning-Based Metric for Functional Alignment in Code Evaluation","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T14:18:44.535532Z"},"links":{"cited_paper":"/paper/2406.06918","citing_paper":"/paper/2505.19502"},"observation_digest":"sha256:0b8631051fbee60a46c7d3484285d84545c3ff584442678cc6badfe8457df14e","observation_id":"a016940c-4a33-4e26-af3d-37407ca86c7d","resolution":{"observed_at":"2026-08-07T14:18:44.535532Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:18:55.595079Z","title":"Assessing and improving syntactic adversarial robustness of pre-trained models for code translation,","venue":null,"work_id":"2270d500-e1c5-404e-81b1-1d87de049a8e","year":2025},"citing_paper":{"arxiv_id":"2505.19502","last_updated":"2025-05-26T04:29:14Z","snapshot_observed_at":"2026-08-08T05:31:17.095413Z","submitted_at":"2025-05-26T04:29:14Z","title":"CODE-DITING: A Reasoning-Based Metric for Functional Alignment in Code Evaluation","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T14:18:44.695755Z"},"links":{"citing_paper":"/paper/2505.19502"},"observation_digest":"sha256:831b1258b95ce7c075ea25f46cf1c87794c95523c521f243fef708284f2b5e06","observation_id":"da753d1c-7523-4255-8b2f-db694ff4245c","resolution":{"observed_at":"2026-08-07T14:18:55.722335Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:18:44.800778Z","title":"Bleu: a method for automatic evaluation of machine translation,","venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2505.19502","last_updated":"2025-05-26T04:29:14Z","snapshot_observed_at":"2026-08-08T05:31:17.095413Z","submitted_at":"2025-05-26T04:29:14Z","title":"CODE-DITING: A Reasoning-Based Metric for Functional Alignment in Code Evaluation","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T14:18:44.800778Z"},"links":{"citing_paper":"/paper/2505.19502"},"observation_digest":"sha256:154ff198077e5f00872474a2e613d8c5dbbff6039a030d328f438f67b22fd2c3","observation_id":"6f840e5e-74ea-4099-b2ff-15a0f23c8e5e","resolution":{"observed_at":"2026-08-07T14:18:44.800778Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:18:44.882525Z","title":"Rouge: A package for automatic evaluation of summaries,","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2505.19502","last_updated":"2025-05-26T04:29:14Z","snapshot_observed_at":"2026-08-08T05:31:17.095413Z","submitted_at":"2025-05-26T04:29:14Z","title":"CODE-DITING: A Reasoning-Based Metric for Functional Alignment in Code Evaluation","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T14:18:44.882525Z"},"links":{"citing_paper":"/paper/2505.19502"},"observation_digest":"sha256:40f31498af0ca71c940d3493079b57590c2c0863832f615938c0c3817197c7d8","observation_id":"be427ef5-801d-43d2-b29f-3dd2615fcca8","resolution":{"observed_at":"2026-08-07T14:18:44.882525Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:18:55.251407Z","title":"chrf: character n-gram f-score for automatic mt evalu- ation,","venue":null,"work_id":"4ba165c5-7daa-4753-aef3-b844061bb623","year":2015},"citing_paper":{"arxiv_id":"2505.19502","last_updated":"2025-05-26T04:29:14Z","snapshot_observed_at":"2026-08-08T05:31:17.095413Z","submitted_at":"2025-05-26T04:29:14Z","title":"CODE-DITING: A Reasoning-Based Metric for Functional Alignment in Code Evaluation","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T14:18:45.020391Z"},"links":{"citing_paper":"/paper/2505.19502"},"observation_digest":"sha256:61a61e216ad3d0755567cafec638e52e9cf77867a7274635c6b1235b14ff70f1","observation_id":"61f6370f-1789-4085-b2ff-43d2915ce993","resolution":{"observed_at":"2026-08-07T14:18:55.399227Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2107.03374","last_updated":"2021-07-14T17:16:02Z","snapshot_observed_at":"2026-08-08T11:58:24.516369Z","submitted_at":"2021-07-07T17:41:24Z","title":"Evaluating Large Language Models Trained on Code","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2107.03374","snapshot_observed_at":"2026-08-07T14:18:45.176339Z","title":"Evaluating large language models trained on code,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.19502","last_updated":"2025-05-26T04:29:14Z","snapshot_observed_at":"2026-08-08T05:31:17.095413Z","submitted_at":"2025-05-26T04:29:14Z","title":"CODE-DITING: A Reasoning-Based Metric for Functional Alignment in Code Evaluation","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T14:18:45.176339Z"},"links":{"cited_paper":"/paper/2107.03374","citing_paper":"/paper/2505.19502"},"observation_digest":"sha256:6dadc4ca2e84a93e02cb21af1622973f5e78fad660571c132b22aca70ae5a4d0","observation_id":"788e8390-42a0-43fb-bbc9-d3f73c7c27f7","resolution":{"observed_at":"2026-08-07T14:18:45.176339Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:18:54.970023Z","title":"Exploit- gen: Template-augmented exploit code generation based on codebert,","venue":null,"work_id":"1ff7227b-c39e-426e-9c8e-5fac076c48fd","year":2023},"citing_paper":{"arxiv_id":"2505.19502","last_updated":"2025-05-26T04:29:14Z","snapshot_observed_at":"2026-08-08T05:31:17.095413Z","submitted_at":"2025-05-26T04:29:14Z","title":"CODE-DITING: A Reasoning-Based Metric for Functional Alignment in Code Evaluation","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T14:18:45.322765Z"},"links":{"citing_paper":"/paper/2505.19502"},"observation_digest":"sha256:d0fd9533a51e8374a7f3a93b937ce36d84d3c74da7a18534394fa395dd0a4912","observation_id":"7bd5d4a7-0764-482d-93dc-49dec8202507","resolution":{"observed_at":"2026-08-07T14:18:55.097618Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:18:54.659488Z","title":"Are nlp metrics suitable for evaluating gen- erated code?","venue":null,"work_id":"bda10864-6094-4f6b-a120-9da9661e35af","year":2022},"citing_paper":{"arxiv_id":"2505.19502","last_updated":"2025-05-26T04:29:14Z","snapshot_observed_at":"2026-08-08T05:31:17.095413Z","submitted_at":"2025-05-26T04:29:14Z","title":"CODE-DITING: A Reasoning-Based Metric for Functional Alignment in Code Evaluation","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T14:18:45.485559Z"},"links":{"citing_paper":"/paper/2505.19502"},"observation_digest":"sha256:65599aa8537d493be8fc0ea29814d14ff359411b87c9324034591cf8e53f2a8d","observation_id":"328742c4-9d6d-4754-9765-2a5d317b0ba1","resolution":{"observed_at":"2026-08-07T14:18:54.811838Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.01580","last_updated":"2024-04-26T15:54:39Z","snapshot_observed_at":"2026-08-09T17:44:43.696646Z","submitted_at":"2024-04-26T15:54:39Z","title":"On the Limitations of Embedding Based Methods for Measuring Functional Correctness for Code Generation","version":1},"cited_work":{"arxiv_id":"2405.01580","doi":null,"metadata_source":"pith","pith_arxiv_id":"2405.01580","snapshot_observed_at":"2026-08-07T14:18:51.225001Z","title":"On the Limitations of Embedding Based Methods for Measuring Functional Correctness for Code Generation","venue":"cs.SE","work_id":"47592709-7e8a-491d-a2ad-8819e8c63645","year":2024},"citing_paper":{"arxiv_id":"2505.19502","last_updated":"2025-05-26T04:29:14Z","snapshot_observed_at":"2026-08-08T05:31:17.095413Z","submitted_at":"2025-05-26T04:29:14Z","title":"CODE-DITING: A Reasoning-Based Metric for Functional Alignment in Code Evaluation","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T14:18:45.617534Z"},"links":{"cited_paper":"/paper/2405.01580","citing_paper":"/paper/2505.19502"},"observation_digest":"sha256:2911e3fc62a8e899930e3187c1bf769cbc61c59980578b66a0952dca4f43947f","observation_id":"af2248f9-f5c9-4c45-84c7-7ea2822b126d","resolution":{"observed_at":"2026-08-07T14:18:51.337928Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05579","last_updated":"2024-12-10T05:49:12Z","snapshot_observed_at":"2026-07-31T01:42:39.468673Z","submitted_at":"2024-12-07T08:07:24Z","title":"LLMs-as-Judges: A Comprehensive Survey on LLM-based Evaluation Methods","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.05579","snapshot_observed_at":"2026-08-07T14:18:45.728953Z","title":"Llms- as-judges: a comprehensive survey on llm-based evaluation methods,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19502","last_updated":"2025-05-26T04:29:14Z","snapshot_observed_at":"2026-08-08T05:31:17.095413Z","submitted_at":"2025-05-26T04:29:14Z","title":"CODE-DITING: A Reasoning-Based Metric for Functional Alignment in Code Evaluation","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T14:18:45.728953Z"},"links":{"cited_paper":"/paper/2412.05579","citing_paper":"/paper/2505.19502"},"observation_digest":"sha256:e6e0c6e3c27ef79cbe645eb8e5123e11b545132b39494e4220e4b5f75f32fa39","observation_id":"7f780868-1084-45f3-a25b-b9518ed9b730","resolution":{"observed_at":"2026-08-07T14:18:45.728953Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.15594","last_updated":"2025-10-19T10:32:43Z","snapshot_observed_at":"2026-08-02T10:23:50.881300Z","submitted_at":"2024-11-23T16:03:35Z","title":"A Survey on LLM-as-a-Judge","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.15594","snapshot_observed_at":"2026-08-07T14:18:45.866412Z","title":"A survey on llm-as-a-judge,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19502","last_updated":"2025-05-26T04:29:14Z","snapshot_observed_at":"2026-08-08T05:31:17.095413Z","submitted_at":"2025-05-26T04:29:14Z","title":"CODE-DITING: A Reasoning-Based Metric for Functional Alignment in Code Evaluation","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T14:18:45.866412Z"},"links":{"cited_paper":"/paper/2411.15594","citing_paper":"/paper/2505.19502"},"observation_digest":"sha256:e0ba2e58acf7a31c18b12d9f33cc99c9af345c2df54986df393b0ff720e01af3","observation_id":"606da85a-ab5e-4433-87a0-1a1720486b5f","resolution":{"observed_at":"2026-08-07T14:18:45.866412Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:18:45.986897Z","title":"From generation to judg- ment: Opportunities and challenges of llm-as-a-judge,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19502","last_updated":"2025-05-26T04:29:14Z","snapshot_observed_at":"2026-08-08T05:31:17.095413Z","submitted_at":"2025-05-26T04:29:14Z","title":"CODE-DITING: A Reasoning-Based Metric for Functional Alignment in Code Evaluation","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T14:18:45.986897Z"},"links":{"citing_paper":"/paper/2505.19502"},"observation_digest":"sha256:05181a0aed68116ec8a82bcb5873c9164347ee47e9fa61485768cd4915f8324f","observation_id":"6591cce8-2b4c-45b4-92b5-db04020bcf7d","resolution":{"observed_at":"2026-08-07T14:18:45.986897Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:18:46.158301Z","title":"Judging llm-as-a-judge with mt-bench and chatbot arena,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.19502","last_updated":"2025-05-26T04:29:14Z","snapshot_observed_at":"2026-08-08T05:31:17.095413Z","submitted_at":"2025-05-26T04:29:14Z","title":"CODE-DITING: A Reasoning-Based Metric for Functional Alignment in Code Evaluation","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T14:18:46.158301Z"},"links":{"citing_paper":"/paper/2505.19502"},"observation_digest":"sha256:02b9b2da0bdd43885737ab365a51ea8737f7abcaa879b8376d01a77dce6b5ecc","observation_id":"954b232b-51e2-48e3-9a83-80db1bc437ab","resolution":{"observed_at":"2026-08-07T14:18:46.158301Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:18:54.331708Z","title":"Fight fire with fire: How much can we trust chatgpt on source code-related tasks?","venue":null,"work_id":"3dd47c0f-49fd-4344-ba6e-ab230a021dad","year":2024},"citing_paper":{"arxiv_id":"2505.19502","last_updated":"2025-05-26T04:29:14Z","snapshot_observed_at":"2026-08-08T05:31:17.095413Z","submitted_at":"2025-05-26T04:29:14Z","title":"CODE-DITING: A Reasoning-Based Metric for Functional Alignment in Code Evaluation","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T14:18:46.267717Z"},"links":{"citing_paper":"/paper/2505.19502"},"observation_digest":"sha256:b027b8e03eb0ac724f61129d8e3c43b969a17dd0574617dfba549d3da4c748cb","observation_id":"2dc63c72-91a8-42d9-ac61-f8f830f53b5b","resolution":{"observed_at":"2026-08-07T14:18:54.479297Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-07T14:18:46.412755Z","title":"Deepseek-r1: Incentivizing reasoning capability in llms via reinforcement learning,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.19502","last_updated":"2025-05-26T04:29:14Z","snapshot_observed_at":"2026-08-08T05:31:17.095413Z","submitted_at":"2025-05-26T04:29:14Z","title":"CODE-DITING: A Reasoning-Based Metric for Functional Alignment in Code Evaluation","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T14:18:46.412755Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2505.19502"},"observation_digest":"sha256:b260a53505fcc0ada067f3508aa6dba13062333e75143bb1132cfa5227cfd8a3","observation_id":"df1fc234-6b03-4450-a8f2-74ceb248c922","resolution":{"observed_at":"2026-08-07T14:18:46.412755Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:18:53.976220Z","title":"Pissa: Principal singular values and singular vectors adaptation of large language models,","venue":null,"work_id":"96afd0f2-557b-474c-b819-373d087bbaee","year":2024},"citing_paper":{"arxiv_id":"2505.19502","last_updated":"2025-05-26T04:29:14Z","snapshot_observed_at":"2026-08-08T05:31:17.095413Z","submitted_at":"2025-05-26T04:29:14Z","title":"CODE-DITING: A Reasoning-Based Metric for Functional Alignment in Code Evaluation","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T14:18:46.534245Z"},"links":{"citing_paper":"/paper/2505.19502"},"observation_digest":"sha256:698b5b4472acfd1a20a26d9298fa4060e7273801dc8ef14dc08812541377262c","observation_id":"5eb22316-f96c-4534-9ccc-4ab52109222b","resolution":{"observed_at":"2026-08-07T14:18:54.106941Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.19437","last_updated":"2025-02-18T17:26:38Z","snapshot_observed_at":"2026-08-11T01:48:59.557045Z","submitted_at":"2024-12-27T04:03:16Z","title":"DeepSeek-V3 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.19437","snapshot_observed_at":"2026-08-07T14:18:46.672703Z","title":"Deepseek-v3 technical report,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19502","last_updated":"2025-05-26T04:29:14Z","snapshot_observed_at":"2026-08-08T05:31:17.095413Z","submitted_at":"2025-05-26T04:29:14Z","title":"CODE-DITING: A Reasoning-Based Metric for Functional Alignment in Code Evaluation","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T14:18:46.672703Z"},"links":{"cited_paper":"/paper/2412.19437","citing_paper":"/paper/2505.19502"},"observation_digest":"sha256:91fdec2471b89821641772e3627ceedc3f9246ccb373c3a8b6541420cbb6da23","observation_id":"fb82432f-3dcd-4202-a6f1-cedd7489ad02","resolution":{"observed_at":"2026-08-07T14:18:46.672703Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:18:46.831139Z","title":"Preference leakage: A contamination problem in llm-as-a-judge,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.19502","last_updated":"2025-05-26T04:29:14Z","snapshot_observed_at":"2026-08-08T05:31:17.095413Z","submitted_at":"2025-05-26T04:29:14Z","title":"CODE-DITING: A Reasoning-Based Metric for Functional Alignment in Code Evaluation","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T14:18:46.831139Z"},"links":{"citing_paper":"/paper/2505.19502"},"observation_digest":"sha256:164649328d29e1893822a590b33bad4f9c77475bae002ba749c0f2659d39905c","observation_id":"19d5527f-75f7-4917-b9f3-278883ebead8","resolution":{"observed_at":"2026-08-07T14:18:46.831139Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:18:53.670247Z","title":"Who evaluates the evaluators? on automatic metrics for assessing ai-based offensive code generators,","venue":null,"work_id":"70b0df2b-5bdb-4dcd-a2b5-923fbec7337d","year":2023},"citing_paper":{"arxiv_id":"2505.19502","last_updated":"2025-05-26T04:29:14Z","snapshot_observed_at":"2026-08-08T05:31:17.095413Z","submitted_at":"2025-05-26T04:29:14Z","title":"CODE-DITING: A Reasoning-Based Metric for Functional Alignment in Code Evaluation","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T14:18:46.961223Z"},"links":{"citing_paper":"/paper/2505.19502"},"observation_digest":"sha256:934ad34ba3cc829e42a392c3d834d4692cb72d3f7dc32de273dc5977deda5306","observation_id":"44ad428f-1c5c-4197-ba0d-3a659e98494a","resolution":{"observed_at":"2026-08-07T14:18:53.843328Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:18:53.384237Z","title":"Crystalbleu: precisely and efficiently mea- suring the similarity of code,","venue":null,"work_id":"af290620-322e-41fb-802d-cb7e6ebdf3de","year":2022},"citing_paper":{"arxiv_id":"2505.19502","last_updated":"2025-05-26T04:29:14Z","snapshot_observed_at":"2026-08-08T05:31:17.095413Z","submitted_at":"2025-05-26T04:29:14Z","title":"CODE-DITING: A Reasoning-Based Metric for Functional Alignment in Code Evaluation","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T14:18:47.156377Z"},"links":{"citing_paper":"/paper/2505.19502"},"observation_digest":"sha256:cf44b5ed063d7d5cb6d0f167a937a22de39c8ed45fd7b800d6cbb56ae380ace7","observation_id":"97dc3270-991f-4aca-8444-5ffd1dab3267","resolution":{"observed_at":"2026-08-07T14:18:53.498388Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2009.10297","last_updated":"2020-09-27T04:07:11Z","snapshot_observed_at":"2026-08-01T07:33:26.380394Z","submitted_at":"2020-09-22T03:10:49Z","title":"CodeBLEU: a Method for Automatic Evaluation of Code Synthesis","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2009.10297","snapshot_observed_at":"2026-08-07T14:18:47.284456Z","title":"Codebleu: a method for automatic evaluation of code synthesis,","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2505.19502","last_updated":"2025-05-26T04:29:14Z","snapshot_observed_at":"2026-08-08T05:31:17.095413Z","submitted_at":"2025-05-26T04:29:14Z","title":"CODE-DITING: A Reasoning-Based Metric for Functional Alignment in Code Evaluation","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T14:18:47.284456Z"},"links":{"cited_paper":"/paper/2009.10297","citing_paper":"/paper/2505.19502"},"observation_digest":"sha256:26e2199fe069d752f6394143cb9685ec9064dd4c481c7b3e94c617f58b504ada","observation_id":"a48577a0-d159-428b-897e-195126bdf97b","resolution":{"observed_at":"2026-08-07T14:18:47.284456Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:18:53.093842Z","title":"Codebertscore: Eval- uating code generation with pretrained models of code,","venue":null,"work_id":"2906f2e2-6d6f-4e88-83a7-0c26dce3ffac","year":2023},"citing_paper":{"arxiv_id":"2505.19502","last_updated":"2025-05-26T04:29:14Z","snapshot_observed_at":"2026-08-08T05:31:17.095413Z","submitted_at":"2025-05-26T04:29:14Z","title":"CODE-DITING: A Reasoning-Based Metric for Functional Alignment in Code Evaluation","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T14:18:47.431493Z"},"links":{"citing_paper":"/paper/2505.19502"},"observation_digest":"sha256:b38b08634138231d1b02695dbe8a165c5e890b437b499bbcffe72d3f8f151114","observation_id":"a87f8fb3-0a76-475d-95e9-3ec920ebc06c","resolution":{"observed_at":"2026-08-07T14:18:53.273794Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:18:52.751704Z","title":"Codescore: Eval- uating code generation by learning code execution,","venue":null,"work_id":"d2a2f12e-4ec3-4ddf-9cfc-0b05d494f787","year":2025},"citing_paper":{"arxiv_id":"2505.19502","last_updated":"2025-05-26T04:29:14Z","snapshot_observed_at":"2026-08-08T05:31:17.095413Z","submitted_at":"2025-05-26T04:29:14Z","title":"CODE-DITING: A Reasoning-Based Metric for Functional Alignment in Code Evaluation","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T14:18:47.555464Z"},"links":{"citing_paper":"/paper/2505.19502"},"observation_digest":"sha256:037436aa7b4a81bcb3a6a4ad2f67ee0a6120e77590cacc05d94a88204de3c179","observation_id":"a1f8e276-a258-4a87-8e3a-99cd99b7399d","resolution":{"observed_at":"2026-08-07T14:18:52.904879Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.06902","last_updated":"2024-06-11T02:51:17Z","snapshot_observed_at":"2026-08-10T03:43:33.009919Z","submitted_at":"2024-06-11T02:51:17Z","title":"CodeScore-R: An Automated Robustness Metric for Assessing the FunctionalCorrectness of Code Synthesis","version":1},"cited_work":{"arxiv_id":"2406.06902","doi":null,"metadata_source":"pith","pith_arxiv_id":"2406.06902","snapshot_observed_at":"2026-08-07T14:18:50.337650Z","title":"CodeScore-R: An Automated Robustness Metric for Assessing the FunctionalCorrectness of Code Synthesis","venue":"cs.SE","work_id":"75033fc2-c507-4296-ad74-59da1d6aaa1f","year":2024},"citing_paper":{"arxiv_id":"2505.19502","last_updated":"2025-05-26T04:29:14Z","snapshot_observed_at":"2026-08-08T05:31:17.095413Z","submitted_at":"2025-05-26T04:29:14Z","title":"CODE-DITING: A Reasoning-Based Metric for Functional Alignment in Code Evaluation","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T14:18:47.689046Z"},"links":{"cited_paper":"/paper/2406.06902","citing_paper":"/paper/2505.19502"},"observation_digest":"sha256:7f0429ce9e67142161acab2879e5c2beff60e88096a9fa1f88076605484d2f38","observation_id":"b97d9c13-1d3a-4464-9b9d-2d0527eba567","resolution":{"observed_at":"2026-08-07T14:18:50.455945Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:18:52.490052Z","title":"Ice-score: Instructing large language models to evaluate code,","venue":null,"work_id":"aea0bede-9623-471a-9b42-c59370f65c9f","year":2024},"citing_paper":{"arxiv_id":"2505.19502","last_updated":"2025-05-26T04:29:14Z","snapshot_observed_at":"2026-08-08T05:31:17.095413Z","submitted_at":"2025-05-26T04:29:14Z","title":"CODE-DITING: A Reasoning-Based Metric for Functional Alignment in Code Evaluation","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T14:18:47.812514Z"},"links":{"citing_paper":"/paper/2505.19502"},"observation_digest":"sha256:23b3c99bc347ec59aec31a4e129be49e44a2eadc3c1806112d25ce6f41da6d75","observation_id":"2aaf3ad2-026c-4451-b6ed-2ba896733148","resolution":{"observed_at":"2026-08-07T14:18:52.590439Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:18:52.237698Z","title":"Codejudge: Evaluating code generation with large language models,","venue":null,"work_id":"79c1d078-218c-4dc9-9f9b-34a13511ab28","year":2024},"citing_paper":{"arxiv_id":"2505.19502","last_updated":"2025-05-26T04:29:14Z","snapshot_observed_at":"2026-08-08T05:31:17.095413Z","submitted_at":"2025-05-26T04:29:14Z","title":"CODE-DITING: A Reasoning-Based Metric for Functional Alignment in Code Evaluation","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T14:18:47.980501Z"},"links":{"citing_paper":"/paper/2505.19502"},"observation_digest":"sha256:cdb4cfcff3fefed4d1fc87d0bc6001e231783b0862b7d22bf3a7b4071fa8fce3","observation_id":"831fc490-587b-43e4-9ad2-14fa7a542494","resolution":{"observed_at":"2026-08-07T14:18:52.336829Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:18:51.890907Z","title":"Benchmarks and metrics for evalua- tions of code generation: A critical review,","venue":null,"work_id":"ab880dd8-a1d6-4cbe-9c60-cb602eb9c978","year":2024},"citing_paper":{"arxiv_id":"2505.19502","last_updated":"2025-05-26T04:29:14Z","snapshot_observed_at":"2026-08-08T05:31:17.095413Z","submitted_at":"2025-05-26T04:29:14Z","title":"CODE-DITING: A Reasoning-Based Metric for Functional Alignment in Code Evaluation","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T14:18:48.119267Z"},"links":{"citing_paper":"/paper/2505.19502"},"observation_digest":"sha256:230bd404cd3b285cfc952b8af6782de5f70f9d0063cf5a24276b1af42e1ed9f5","observation_id":"d1b05140-ba45-4990-8fa0-9b199a50692d","resolution":{"observed_at":"2026-08-07T14:18:52.066356Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.02246","last_updated":"2025-03-04T03:48:23Z","snapshot_observed_at":"2026-08-07T17:31:39.128866Z","submitted_at":"2025-03-04T03:48:23Z","title":"From Code to Courtroom: LLMs as the New Software Judges","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.02246","snapshot_observed_at":"2026-08-07T14:18:48.242132Z","title":"From code to courtroom: Llms as the new software judges,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.19502","last_updated":"2025-05-26T04:29:14Z","snapshot_observed_at":"2026-08-08T05:31:17.095413Z","submitted_at":"2025-05-26T04:29:14Z","title":"CODE-DITING: A Reasoning-Based Metric for Functional Alignment in Code Evaluation","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T14:18:48.242132Z"},"links":{"cited_paper":"/paper/2503.02246","citing_paper":"/paper/2505.19502"},"observation_digest":"sha256:b88c6001d4c496955178aa25c3fe2092ea079afc1520a2574114fcec10d42abc","observation_id":"20add06a-1154-416b-8b05-f3a185bb4f3b","resolution":{"observed_at":"2026-08-07T14:18:48.242132Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:18:51.614985Z","title":"Is your code generated by chatGPT really correct? rigorous evaluation of large language models for code generation,","venue":null,"work_id":"62cf0829-9bd1-448e-a806-3cb9060e0da3","year":2023},"citing_paper":{"arxiv_id":"2505.19502","last_updated":"2025-05-26T04:29:14Z","snapshot_observed_at":"2026-08-08T05:31:17.095413Z","submitted_at":"2025-05-26T04:29:14Z","title":"CODE-DITING: A Reasoning-Based Metric for Functional Alignment in Code Evaluation","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T14:18:48.442996Z"},"links":{"citing_paper":"/paper/2505.19502"},"observation_digest":"sha256:327ec18984475c78bebcb23c07ee4984eea9efcbf8681374de0be6d17a16cf74","observation_id":"42377c96-b83f-44c4-8a1d-359778743253","resolution":{"observed_at":"2026-08-07T14:18:51.761783Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.15877","last_updated":"2025-04-01T08:36:44Z","snapshot_observed_at":"2026-07-31T19:00:59.311189Z","submitted_at":"2024-06-22T15:52:04Z","title":"BigCodeBench: Benchmarking Code Generation with Diverse Function Calls and Complex Instructions","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.15877","snapshot_observed_at":"2026-08-07T14:18:48.551215Z","title":"Bigcodebench: Benchmarking code generation with diverse function calls and complex instructions,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19502","last_updated":"2025-05-26T04:29:14Z","snapshot_observed_at":"2026-08-08T05:31:17.095413Z","submitted_at":"2025-05-26T04:29:14Z","title":"CODE-DITING: A Reasoning-Based Metric for Functional Alignment in Code Evaluation","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T14:18:48.551215Z"},"links":{"cited_paper":"/paper/2406.15877","citing_paper":"/paper/2505.19502"},"observation_digest":"sha256:a61e4ceadc131613c1c0e52c899ba1cde1ad6166bda94459d40e0384198cca73","observation_id":"c35ee74f-45a5-416f-9a9e-a9027fa1014a","resolution":{"observed_at":"2026-08-07T14:18:48.551215Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12186","last_updated":"2024-11-12T13:24:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-18T17:57:57Z","title":"Qwen2.5-Coder Technical Report","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12186","snapshot_observed_at":"2026-08-07T14:18:48.666706Z","title":"Qwen2. 5-coder technical report,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19502","last_updated":"2025-05-26T04:29:14Z","snapshot_observed_at":"2026-08-08T05:31:17.095413Z","submitted_at":"2025-05-26T04:29:14Z","title":"CODE-DITING: A Reasoning-Based Metric for Functional Alignment in Code Evaluation","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T14:18:48.666706Z"},"links":{"cited_paper":"/paper/2409.12186","citing_paper":"/paper/2505.19502"},"observation_digest":"sha256:f87ebe8cc666d7b8671bc6ec33e28dad38ebb515c8709b28f6123eb9409a6ee8","observation_id":"d5e8fd5b-c57c-445c-88d3-ed7d2cb88b75","resolution":{"observed_at":"2026-08-07T14:18:48.666706Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.14196","last_updated":"2024-01-26T09:23:11Z","snapshot_observed_at":"2026-08-06T22:40:28.707813Z","submitted_at":"2024-01-25T14:17:53Z","title":"DeepSeek-Coder: When the Large Language Model Meets Programming -- The Rise of Code Intelligence","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.14196","snapshot_observed_at":"2026-08-07T14:18:48.828289Z","title":"Deepseek-coder: When the large language model meets programming–the rise of code intelligence,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19502","last_updated":"2025-05-26T04:29:14Z","snapshot_observed_at":"2026-08-08T05:31:17.095413Z","submitted_at":"2025-05-26T04:29:14Z","title":"CODE-DITING: A Reasoning-Based Metric for Functional Alignment in Code Evaluation","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T14:18:48.828289Z"},"links":{"cited_paper":"/paper/2401.14196","citing_paper":"/paper/2505.19502"},"observation_digest":"sha256:91300a6c66376c3151d21853e5a274ed950b6dc1b0417a79b954f00cca5ea8c1","observation_id":"5b65b982-8887-435a-ac28-b5f595e03134","resolution":{"observed_at":"2026-08-07T14:18:48.828289Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:18:48.977432Z","title":"Chain-of-thought prompting elicits reasoning in large language models,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.19502","last_updated":"2025-05-26T04:29:14Z","snapshot_observed_at":"2026-08-08T05:31:17.095413Z","submitted_at":"2025-05-26T04:29:14Z","title":"CODE-DITING: A Reasoning-Based Metric for Functional Alignment in Code Evaluation","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T14:18:48.977432Z"},"links":{"citing_paper":"/paper/2505.19502"},"observation_digest":"sha256:d34269bd4f429d05d0128627310b605c2590f4c35e2519584a6a2e6cb45ac7d8","observation_id":"d316dd0b-02f7-4b68-99aa-12cdd7cda6d6","resolution":{"observed_at":"2026-08-07T14:18:48.977432Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:18:49.169400Z","title":"Efficient memory management for large language model serving with pagedattention,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.19502","last_updated":"2025-05-26T04:29:14Z","snapshot_observed_at":"2026-08-08T05:31:17.095413Z","submitted_at":"2025-05-26T04:29:14Z","title":"CODE-DITING: A Reasoning-Based Metric for Functional Alignment in Code Evaluation","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T14:18:49.169400Z"},"links":{"citing_paper":"/paper/2505.19502"},"observation_digest":"sha256:45c8ea9c2703ff1d0ce30ce1327abb405384fef9660e58f0e0fcb42ac58986fa","observation_id":"8a620128-32a8-4efc-9f36-9fb7a9a7ba48","resolution":{"observed_at":"2026-08-07T14:18:49.169400Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.02951","last_updated":"2025-07-12T02:08:21Z","snapshot_observed_at":"2026-08-07T17:29:28.382943Z","submitted_at":"2025-03-04T19:17:36Z","title":"KodCode: A Diverse, Challenging, and Verifiable Synthetic Dataset for Coding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.02951","snapshot_observed_at":"2026-08-07T14:18:49.297876Z","title":"Kodcode: A diverse, challenging, and verifiable synthetic dataset for coding,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.19502","last_updated":"2025-05-26T04:29:14Z","snapshot_observed_at":"2026-08-08T05:31:17.095413Z","submitted_at":"2025-05-26T04:29:14Z","title":"CODE-DITING: A Reasoning-Based Metric for Functional Alignment in Code Evaluation","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T14:18:49.297876Z"},"links":{"cited_paper":"/paper/2503.02951","citing_paper":"/paper/2505.19502"},"observation_digest":"sha256:f92fef3501dfc7b925c1fa317c3fd6cf8d92bf3916320a7913589a26c2ab1cd8","observation_id":"3a2a8f9d-ef7c-44b5-8dbe-1e0898697da3","resolution":{"observed_at":"2026-08-07T14:18:49.297876Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.04905","last_updated":"2025-03-20T03:28:56Z","snapshot_observed_at":"2026-08-11T08:46:04.544195Z","submitted_at":"2024-11-07T17:47:25Z","title":"OpenCoder: The Open Cookbook for Top-Tier Code Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.04905","snapshot_observed_at":"2026-08-07T14:18:49.422123Z","title":"Opencoder: The open cookbook for top-tier code large language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19502","last_updated":"2025-05-26T04:29:14Z","snapshot_observed_at":"2026-08-08T05:31:17.095413Z","submitted_at":"2025-05-26T04:29:14Z","title":"CODE-DITING: A Reasoning-Based Metric for Functional Alignment in Code Evaluation","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T14:18:49.422123Z"},"links":{"cited_paper":"/paper/2411.04905","citing_paper":"/paper/2505.19502"},"observation_digest":"sha256:b20d086c95122854535fa12dab25c4daf9a6600636d36c41c937e11fd124846c","observation_id":"d4780c4b-4d30-4d97-8fbc-306e2706f1f9","resolution":{"observed_at":"2026-08-07T14:18:49.422123Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15921","last_updated":"2025-04-23T23:24:01Z","snapshot_observed_at":"2026-08-11T10:55:17.496931Z","submitted_at":"2024-12-20T14:13:09Z","title":"Less is More: Towards Green Code Large Language Models via Unified Structural Pruning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15921","snapshot_observed_at":"2026-08-07T14:18:49.570812Z","title":"Less is more: Towards green code large language models via unified structural pruning,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19502","last_updated":"2025-05-26T04:29:14Z","snapshot_observed_at":"2026-08-08T05:31:17.095413Z","submitted_at":"2025-05-26T04:29:14Z","title":"CODE-DITING: A Reasoning-Based Metric for Functional Alignment in Code Evaluation","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T14:18:49.570812Z"},"links":{"cited_paper":"/paper/2412.15921","citing_paper":"/paper/2505.19502"},"observation_digest":"sha256:67f333ab9d31fc9c81e8811a6ab5ba7bc74e2f0eb6b362941120f13efaccab8e","observation_id":"f38a23b2-d917-42f4-92ce-7d3fdfb8d31c","resolution":{"observed_at":"2026-08-07T14:18:49.570812Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:18:49.765210Z","title":"Delving deep into rectifiers: Surpassing human-level performance on imagenet classification,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2505.19502","last_updated":"2025-05-26T04:29:14Z","snapshot_observed_at":"2026-08-08T05:31:17.095413Z","submitted_at":"2025-05-26T04:29:14Z","title":"CODE-DITING: A Reasoning-Based Metric for Functional Alignment in Code Evaluation","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T14:18:49.765210Z"},"links":{"citing_paper":"/paper/2505.19502"},"observation_digest":"sha256:f52db7167051a9d5607d9d35274abdcd8422dc96955b8201e398c73b93e8feb1","observation_id":"4877cb16-649c-4715-ab71-f88e482f3690","resolution":{"observed_at":"2026-08-07T14:18:49.765210Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:18:49.895278Z","title":"A coefficient of agreement for nominal scales,","venue":null,"work_id":null,"year":1960},"citing_paper":{"arxiv_id":"2505.19502","last_updated":"2025-05-26T04:29:14Z","snapshot_observed_at":"2026-08-08T05:31:17.095413Z","submitted_at":"2025-05-26T04:29:14Z","title":"CODE-DITING: A Reasoning-Based Metric for Functional Alignment in Code Evaluation","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T14:18:49.895278Z"},"links":{"citing_paper":"/paper/2505.19502"},"observation_digest":"sha256:f0a25feab669fecc870ac6cf9d2e2c691a41b9358625bcc5c9b5918b10de7bbe","observation_id":"6d7b34fb-a8b3-4a53-b612-d2274275d5a2","resolution":{"observed_at":"2026-08-07T14:18:49.895278Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2505.19502","last_updated":"2025-05-26T04:29:14Z","latest_version":1,"primary_category":"cs.SE","snapshot_observed_at":"2026-08-08T05:31:17.095413Z","submitted_at":"2025-05-26T04:29:14Z","title":"CODE-DITING: A Reasoning-Based Metric for Functional Alignment in Code Evaluation"},"reference_resolution":{"displayed":46,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":29,"verified_exact":2,"verified_fuzzy":15},"total_outbound_references":46},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"thesis":"As of 11 August 2026, this Paper Citation Record lists 46 of 46 outbound references and 1 inbound Pith citation observation for arXiv:2505.19502."}