{"as_of":"2026-08-20T02:53:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:10bbb431b0835f9928652231b6c2029dfd7697629ed0f186509ba5b72998a36b","coverage":[{"denominator":32,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":32,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T00:59:57.155640Z","state":"measured"},{"denominator":33,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":33,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-19T06:32:44.657259+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T22:23:18.237307Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"pith","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":0,"observed_at":"2026-08-05T02:28:24.338817Z","source":"pith"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.12278","last_updated":"2025-06-13T23:56:17Z","snapshot_observed_at":"2026-08-10T22:43:56.916807Z","submitted_at":"2025-06-13T23:56:17Z","title":"Can LLMs Generate High-Quality Test Cases for Algorithm Problems? TestCase-Eval: A Systematic Evaluation of Fault Coverage and Exposure","version":1},"cited_work":{"arxiv_id":"2506.12278","doi":"10.48550/arxiv.2506.12278","metadata_source":"pith","pith_arxiv_id":"2506.12278","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"Can LLMs Generate High-Quality Test Cases for Algorithm Problems? TestCase-Eval: A Systematic Evaluation of Fault Coverage and Exposure","venue":"cs.SE","work_id":"cecd1cdb-d063-49cd-9ed5-edeef953eec3","year":2025},"citing_paper":{"arxiv_id":"2608.01715","last_updated":"2026-08-03T05:24:03Z","snapshot_observed_at":"2026-08-18T18:28:25.453381Z","submitted_at":"2026-08-03T05:24:03Z","title":"Coding Agents as Test-Suite Auditors: Finding What Official Suites Miss While Approaching What They Catch","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-04T22:23:18.237307Z"},"links":{"cited_paper":"/paper/2506.12278","citing_paper":"/paper/2608.01715"},"observation_digest":"sha256:46230080194e285892ddd64df1b25915860b16d82e835d97a4e7a1dd8f2d326f","observation_id":"e45ec79c-5879-4031-a6ac-3a2f2c27ff7c","resolution":{"observed_at":"2026-08-04T22:23:18.639334Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2506.12278/citation-record","integrity":"/paper/2506.12278/integrity","json":"/paper/2506.12278/citation-record.json","paper":"/paper/2506.12278"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:59:55.449687Z","title":"URL: \" 'urlintro :=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.12278","last_updated":"2025-06-13T23:56:17Z","snapshot_observed_at":"2026-08-10T22:43:56.916807Z","submitted_at":"2025-06-13T23:56:17Z","title":"Can LLMs Generate High-Quality Test Cases for Algorithm Problems? TestCase-Eval: A Systematic Evaluation of Fault Coverage and Exposure","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-07T00:59:55.449687Z"},"links":{"citing_paper":"/paper/2506.12278"},"observation_digest":"sha256:b3f19a5aa7f946ecd53e535eead9d8d9fc1926162d2ba9017f25aa72f2be6aca","observation_id":"8b2839ec-2f8c-47cd-80a4-0d0fccdb0135","resolution":{"observed_at":"2026-08-07T00:59:55.449687Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:59:55.488543Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.12278","last_updated":"2025-06-13T23:56:17Z","snapshot_observed_at":"2026-08-10T22:43:56.916807Z","submitted_at":"2025-06-13T23:56:17Z","title":"Can LLMs Generate High-Quality Test Cases for Algorithm Problems? TestCase-Eval: A Systematic Evaluation of Fault Coverage and Exposure","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-07T00:59:55.488543Z"},"links":{"citing_paper":"/paper/2506.12278"},"observation_digest":"sha256:88e4aecccc06be7ae9e39e840d647dd1f3fc8cb87b3e1a5b12e87e52800af6e9","observation_id":"6bae24c5-efac-42ed-8b35-d3c0a7b056f8","resolution":{"observed_at":"2026-08-07T00:59:55.488543Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2108.07732","last_updated":"2021-08-16T03:57:30Z","snapshot_observed_at":"2026-08-15T17:40:38.050939Z","submitted_at":"2021-08-16T03:57:30Z","title":"Program Synthesis with Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2108.07732","snapshot_observed_at":"2026-08-07T00:59:55.528534Z","title":"Cai, Michael Terry, Quoc V","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.12278","last_updated":"2025-06-13T23:56:17Z","snapshot_observed_at":"2026-08-10T22:43:56.916807Z","submitted_at":"2025-06-13T23:56:17Z","title":"Can LLMs Generate High-Quality Test Cases for Algorithm Problems? TestCase-Eval: A Systematic Evaluation of Fault Coverage and Exposure","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-07T00:59:55.528534Z"},"links":{"cited_paper":"/paper/2108.07732","citing_paper":"/paper/2506.12278"},"observation_digest":"sha256:5eebd7f553ccf54e2f3ab5c9c742e89dc05978b7a1716905638d4c2ab62d190d","observation_id":"9357e788-225b-474c-a621-88c5dadac4e2","resolution":{"observed_at":"2026-08-07T00:59:55.528534Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2207.10397","last_updated":"2022-11-23T07:42:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-07-21T10:18:37Z","title":"CodeT: Code Generation with Generated Tests","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2207.10397","snapshot_observed_at":"2026-08-07T00:59:55.577526Z","title":"Nguyen, Daoguang Zan, Zeqi Lin, Jian-Guang Lou, and Weizhu Chen","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.12278","last_updated":"2025-06-13T23:56:17Z","snapshot_observed_at":"2026-08-10T22:43:56.916807Z","submitted_at":"2025-06-13T23:56:17Z","title":"Can LLMs Generate High-Quality Test Cases for Algorithm Problems? TestCase-Eval: A Systematic Evaluation of Fault Coverage and Exposure","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-07T00:59:55.577526Z"},"links":{"cited_paper":"/paper/2207.10397","citing_paper":"/paper/2506.12278"},"observation_digest":"sha256:2ed30ddc68a10186e602edf8ee3e1d0dbc3694a350775b59ad277e7288d7de73","observation_id":"f0fcd630-95d4-4a1c-8cf3-72eac5cb2b66","resolution":{"observed_at":"2026-08-07T00:59:55.577526Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:59:58.491713Z","title":null,"venue":null,"work_id":"911ff8b7-7fa4-449f-bb6d-4854a3b068ed","year":2025},"citing_paper":{"arxiv_id":"2506.12278","last_updated":"2025-06-13T23:56:17Z","snapshot_observed_at":"2026-08-10T22:43:56.916807Z","submitted_at":"2025-06-13T23:56:17Z","title":"Can LLMs Generate High-Quality Test Cases for Algorithm Problems? TestCase-Eval: A Systematic Evaluation of Fault Coverage and Exposure","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-07T00:59:55.643613Z"},"links":{"citing_paper":"/paper/2506.12278"},"observation_digest":"sha256:849177f5486989b048b8dd5cc5e4462f30f696d3db1c8cd6d4c0f5232ca2ce54","observation_id":"2c973e75-acea-4a9d-9d4b-13a3edf2bd11","resolution":{"observed_at":"2026-08-07T00:59:58.535412Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:59:58.370979Z","title":null,"venue":null,"work_id":"6221f9f6-90a3-4791-bf4d-07bbc758ddab","year":2024},"citing_paper":{"arxiv_id":"2506.12278","last_updated":"2025-06-13T23:56:17Z","snapshot_observed_at":"2026-08-10T22:43:56.916807Z","submitted_at":"2025-06-13T23:56:17Z","title":"Can LLMs Generate High-Quality Test Cases for Algorithm Problems? TestCase-Eval: A Systematic Evaluation of Fault Coverage and Exposure","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-07T00:59:55.697873Z"},"links":{"citing_paper":"/paper/2506.12278"},"observation_digest":"sha256:2e45a6e5fb4316bf94a33c782ad07ef7f4ec6ced4feb83b5c8bb6a47cd354eef","observation_id":"5ec18424-40c3-4059-ab3c-58815dc5dec9","resolution":{"observed_at":"2026-08-07T00:59:58.441772Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:59:58.191243Z","title":null,"venue":null,"work_id":"ec621d16-468c-4522-ba52-a5d451cb3205","year":2025},"citing_paper":{"arxiv_id":"2506.12278","last_updated":"2025-06-13T23:56:17Z","snapshot_observed_at":"2026-08-10T22:43:56.916807Z","submitted_at":"2025-06-13T23:56:17Z","title":"Can LLMs Generate High-Quality Test Cases for Algorithm Problems? TestCase-Eval: A Systematic Evaluation of Fault Coverage and Exposure","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-07T00:59:55.749505Z"},"links":{"citing_paper":"/paper/2506.12278"},"observation_digest":"sha256:e18c50711252fe7189f7b208e3766c0b49bcb7faa2db82a6d841e1f6a70d39b8","observation_id":"b6de7f7d-4bb7-4f45-b2d0-b29c985193c0","resolution":{"observed_at":"2026-08-07T00:59:58.293660Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2105.09938","last_updated":"2021-11-08T21:16:44Z","snapshot_observed_at":"2026-08-14T15:19:05.440904Z","submitted_at":"2021-05-20T17:58:42Z","title":"Measuring Coding Challenge Competence With APPS","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2105.09938","snapshot_observed_at":"2026-08-07T00:59:55.796486Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.12278","last_updated":"2025-06-13T23:56:17Z","snapshot_observed_at":"2026-08-10T22:43:56.916807Z","submitted_at":"2025-06-13T23:56:17Z","title":"Can LLMs Generate High-Quality Test Cases for Algorithm Problems? TestCase-Eval: A Systematic Evaluation of Fault Coverage and Exposure","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-07T00:59:55.796486Z"},"links":{"cited_paper":"/paper/2105.09938","citing_paper":"/paper/2506.12278"},"observation_digest":"sha256:6930200da3a374b3d2c1a6379623ca1c60afa285956a705d6a97222cb298729c","observation_id":"4758ddc3-7b90-4bbe-82f4-52b61c663c71","resolution":{"observed_at":"2026-08-07T00:59:55.796486Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:59:58.073497Z","title":null,"venue":null,"work_id":"f269cd97-1eea-41a1-8e71-8b3c4daeca96","year":2023},"citing_paper":{"arxiv_id":"2506.12278","last_updated":"2025-06-13T23:56:17Z","snapshot_observed_at":"2026-08-10T22:43:56.916807Z","submitted_at":"2025-06-13T23:56:17Z","title":"Can LLMs Generate High-Quality Test Cases for Algorithm Problems? TestCase-Eval: A Systematic Evaluation of Fault Coverage and Exposure","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-07T00:59:55.840677Z"},"links":{"citing_paper":"/paper/2506.12278"},"observation_digest":"sha256:cbb7a5c8919c4dbaa840cac6039d4ad7fa471bc0ad79bff75d90598ed7ef5e21","observation_id":"6d0816bf-0534-4ead-8f52-90685a61d73d","resolution":{"observed_at":"2026-08-07T00:59:58.125813Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12186","last_updated":"2024-11-12T13:24:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-18T17:57:57Z","title":"Qwen2.5-Coder Technical Report","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12186","snapshot_observed_at":"2026-08-07T00:59:55.909403Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.12278","last_updated":"2025-06-13T23:56:17Z","snapshot_observed_at":"2026-08-10T22:43:56.916807Z","submitted_at":"2025-06-13T23:56:17Z","title":"Can LLMs Generate High-Quality Test Cases for Algorithm Problems? TestCase-Eval: A Systematic Evaluation of Fault Coverage and Exposure","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-07T00:59:55.909403Z"},"links":{"cited_paper":"/paper/2409.12186","citing_paper":"/paper/2506.12278"},"observation_digest":"sha256:7935e38dc8d4b441ea78b8f3a3a55c221adac37463bdd61b49482d6958f63e63","observation_id":"579d2730-740a-4c4a-b838-42d053e23109","resolution":{"observed_at":"2026-08-07T00:59:55.909403Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.07974","last_updated":"2024-06-06T17:41:21Z","snapshot_observed_at":"2026-08-16T07:05:57.323612Z","submitted_at":"2024-03-12T17:58:04Z","title":"LiveCodeBench: Holistic and Contamination Free Evaluation of Large Language Models for Code","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.07974","snapshot_observed_at":"2026-08-07T00:59:55.967202Z","title":"Wang, Armando Solar-Lezama, Koushik Sen, and Ion Stoica","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.12278","last_updated":"2025-06-13T23:56:17Z","snapshot_observed_at":"2026-08-10T22:43:56.916807Z","submitted_at":"2025-06-13T23:56:17Z","title":"Can LLMs Generate High-Quality Test Cases for Algorithm Problems? TestCase-Eval: A Systematic Evaluation of Fault Coverage and Exposure","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-07T00:59:55.967202Z"},"links":{"cited_paper":"/paper/2403.07974","citing_paper":"/paper/2506.12278"},"observation_digest":"sha256:8e1aa90ef2eb0f9407fdb750261c597ab2caae242b2158753c73606d5db5ef40","observation_id":"7d885ef1-8f1a-4e6d-8d0b-4b74e4a8a81a","resolution":{"observed_at":"2026-08-07T00:59:55.967202Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06825","last_updated":"2023-10-10T17:54:58Z","snapshot_observed_at":"2026-08-17T20:30:34.016254Z","submitted_at":"2023-10-10T17:54:58Z","title":"Mistral 7B","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06825","snapshot_observed_at":"2026-08-07T00:59:56.011602Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.12278","last_updated":"2025-06-13T23:56:17Z","snapshot_observed_at":"2026-08-10T22:43:56.916807Z","submitted_at":"2025-06-13T23:56:17Z","title":"Can LLMs Generate High-Quality Test Cases for Algorithm Problems? TestCase-Eval: A Systematic Evaluation of Fault Coverage and Exposure","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-07T00:59:56.011602Z"},"links":{"cited_paper":"/paper/2310.06825","citing_paper":"/paper/2506.12278"},"observation_digest":"sha256:dd0a47e17047ddca45e51bc451e2e2cf2ddc77d9300dfa0a39cafc5f98aae47b","observation_id":"72f97c88-b4e1-481f-8359-f5d747b3c45d","resolution":{"observed_at":"2026-08-07T00:59:56.011602Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.16345","last_updated":"2025-02-14T09:32:11Z","snapshot_observed_at":"2026-08-18T01:13:52.673145Z","submitted_at":"2024-11-25T12:44:02Z","title":"Preference Optimization for Reasoning with Pseudo Feedback","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.16345","snapshot_observed_at":"2026-08-07T00:59:56.058442Z","title":"Chen, Shafiq Joty, and Furu Wei","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.12278","last_updated":"2025-06-13T23:56:17Z","snapshot_observed_at":"2026-08-10T22:43:56.916807Z","submitted_at":"2025-06-13T23:56:17Z","title":"Can LLMs Generate High-Quality Test Cases for Algorithm Problems? TestCase-Eval: A Systematic Evaluation of Fault Coverage and Exposure","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-07T00:59:56.058442Z"},"links":{"cited_paper":"/paper/2411.16345","citing_paper":"/paper/2506.12278"},"observation_digest":"sha256:e797551bc5bc9f5fec4cc9c2ee317b87ea3aeeb9d1df5ca60571ef27cabf5b34","observation_id":"e8e3f768-a80e-443a-9303-c26bbbe2ec9a","resolution":{"observed_at":"2026-08-07T00:59:56.058442Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06770","last_updated":"2024-11-11T23:05:04Z","snapshot_observed_at":"2026-08-18T08:11:45.716032Z","submitted_at":"2023-10-10T16:47:29Z","title":"SWE-bench: Can Language Models Resolve Real-World GitHub Issues?","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06770","snapshot_observed_at":"2026-08-07T00:59:56.102230Z","title":"Jimenez, John Yang, Alexander Wettig, Shunyu Yao, Kexin Pei, Ofir Press, and Karthik Narasimhan","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.12278","last_updated":"2025-06-13T23:56:17Z","snapshot_observed_at":"2026-08-10T22:43:56.916807Z","submitted_at":"2025-06-13T23:56:17Z","title":"Can LLMs Generate High-Quality Test Cases for Algorithm Problems? TestCase-Eval: A Systematic Evaluation of Fault Coverage and Exposure","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-07T00:59:56.102230Z"},"links":{"cited_paper":"/paper/2310.06770","citing_paper":"/paper/2506.12278"},"observation_digest":"sha256:7814367c533fdbc4a79d79e3807c3f848939d7d4bada4d10e56eca9f0df276f1","observation_id":"1ab15e48-f62f-414a-b04d-f652a415dbcc","resolution":{"observed_at":"2026-08-07T00:59:56.102230Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.03004","last_updated":"2023-11-06T07:16:58Z","snapshot_observed_at":"2026-08-20T01:11:40.396610Z","submitted_at":"2023-03-06T10:08:51Z","title":"xCodeEval: A Large Scale Multilingual Multitask Benchmark for Code Understanding, Generation, Translation and Retrieval","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.03004","snapshot_observed_at":"2026-08-07T00:59:56.156125Z","title":"Rizwan Parvez, and Shafiq R","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.12278","last_updated":"2025-06-13T23:56:17Z","snapshot_observed_at":"2026-08-10T22:43:56.916807Z","submitted_at":"2025-06-13T23:56:17Z","title":"Can LLMs Generate High-Quality Test Cases for Algorithm Problems? TestCase-Eval: A Systematic Evaluation of Fault Coverage and Exposure","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-07T00:59:56.156125Z"},"links":{"cited_paper":"/paper/2303.03004","citing_paper":"/paper/2506.12278"},"observation_digest":"sha256:d996ee1ae7e68a5dcff6c92f96031de8cf38e8355ea44fdbcfed4968b239986d","observation_id":"8e088c84-d7d5-4cc4-ac74-4ab1c6de13d2","resolution":{"observed_at":"2026-08-07T00:59:56.156125Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:59:57.945238Z","title":null,"venue":null,"work_id":"d032380a-8007-4862-9b55-7ac8ae5cbd11","year":2022},"citing_paper":{"arxiv_id":"2506.12278","last_updated":"2025-06-13T23:56:17Z","snapshot_observed_at":"2026-08-10T22:43:56.916807Z","submitted_at":"2025-06-13T23:56:17Z","title":"Can LLMs Generate High-Quality Test Cases for Algorithm Problems? TestCase-Eval: A Systematic Evaluation of Fault Coverage and Exposure","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-07T00:59:56.214726Z"},"links":{"citing_paper":"/paper/2506.12278"},"observation_digest":"sha256:5c4fdfb976e31dbd33a5f645090bc1df37ea82b2d010902a96d98fc81b538e02","observation_id":"1f386c15-9adc-4574-8705-18903fad0810","resolution":{"observed_at":"2026-08-07T00:59:57.995930Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.01210","last_updated":"2023-10-30T19:37:09Z","snapshot_observed_at":"2026-08-12T18:11:04.754824Z","submitted_at":"2023-05-02T05:46:48Z","title":"Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.01210","snapshot_observed_at":"2026-08-07T00:59:56.261209Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.12278","last_updated":"2025-06-13T23:56:17Z","snapshot_observed_at":"2026-08-10T22:43:56.916807Z","submitted_at":"2025-06-13T23:56:17Z","title":"Can LLMs Generate High-Quality Test Cases for Algorithm Problems? TestCase-Eval: A Systematic Evaluation of Fault Coverage and Exposure","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-07T00:59:56.261209Z"},"links":{"cited_paper":"/paper/2305.01210","citing_paper":"/paper/2506.12278"},"observation_digest":"sha256:dfe2b2bd8a50ee1b1c813dbd43cf2b86842730e9c372791b233490ed6432d40c","observation_id":"7225e502-4e22-4b42-8d75-dfaad8008844","resolution":{"observed_at":"2026-08-07T00:59:56.261209Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-13T17:20:44.002518Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-07T00:59:56.303293Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.12278","last_updated":"2025-06-13T23:56:17Z","snapshot_observed_at":"2026-08-10T22:43:56.916807Z","submitted_at":"2025-06-13T23:56:17Z","title":"Can LLMs Generate High-Quality Test Cases for Algorithm Problems? TestCase-Eval: A Systematic Evaluation of Fault Coverage and Exposure","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-07T00:59:56.303293Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2506.12278"},"observation_digest":"sha256:883c3fc6b1954f5baeaecedd20c52e78e4bd0386e5a290acb7d34cbfb8a98062","observation_id":"84c7e1cf-d8ef-41dd-b371-cce4142af3e8","resolution":{"observed_at":"2026-08-07T00:59:56.303293Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:59:56.348914Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.12278","last_updated":"2025-06-13T23:56:17Z","snapshot_observed_at":"2026-08-10T22:43:56.916807Z","submitted_at":"2025-06-13T23:56:17Z","title":"Can LLMs Generate High-Quality Test Cases for Algorithm Problems? TestCase-Eval: A Systematic Evaluation of Fault Coverage and Exposure","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-07T00:59:56.348914Z"},"links":{"citing_paper":"/paper/2506.12278"},"observation_digest":"sha256:dd0c6e0402281c39a5c2efb849f10514e61363cffc66c79ae6d59c61b2649290","observation_id":"6c82f0ca-7153-41d4-ad1d-71a6882961f5","resolution":{"observed_at":"2026-08-07T00:59:56.348914Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:59:56.419184Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.12278","last_updated":"2025-06-13T23:56:17Z","snapshot_observed_at":"2026-08-10T22:43:56.916807Z","submitted_at":"2025-06-13T23:56:17Z","title":"Can LLMs Generate High-Quality Test Cases for Algorithm Problems? TestCase-Eval: A Systematic Evaluation of Fault Coverage and Exposure","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-07T00:59:56.419184Z"},"links":{"citing_paper":"/paper/2506.12278"},"observation_digest":"sha256:78001c501f047104ea3c2acac54eae90be182e7d8c95ae46c72875d8cdf00b9a","observation_id":"cd7fbad9-537e-4b7d-8d93-047f1f0cd5fa","resolution":{"observed_at":"2026-08-07T00:59:56.419184Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:59:57.774410Z","title":null,"venue":null,"work_id":"e346c83a-3019-4b4b-a395-1342ec86ac19","year":2025},"citing_paper":{"arxiv_id":"2506.12278","last_updated":"2025-06-13T23:56:17Z","snapshot_observed_at":"2026-08-10T22:43:56.916807Z","submitted_at":"2025-06-13T23:56:17Z","title":"Can LLMs Generate High-Quality Test Cases for Algorithm Problems? TestCase-Eval: A Systematic Evaluation of Fault Coverage and Exposure","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-07T00:59:56.484715Z"},"links":{"citing_paper":"/paper/2506.12278"},"observation_digest":"sha256:767e6d8c3c740f78bf8e53e7d00b64973f3c9fd85e162c50875b46d2406a7b9d","observation_id":"248077a6-a411-41f8-99c7-4985da679302","resolution":{"observed_at":"2026-08-07T00:59:57.832291Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:59:57.670257Z","title":null,"venue":null,"work_id":"f04e43d6-a8c5-4d3f-8724-532557e63547","year":2023},"citing_paper":{"arxiv_id":"2506.12278","last_updated":"2025-06-13T23:56:17Z","snapshot_observed_at":"2026-08-10T22:43:56.916807Z","submitted_at":"2025-06-13T23:56:17Z","title":"Can LLMs Generate High-Quality Test Cases for Algorithm Problems? TestCase-Eval: A Systematic Evaluation of Fault Coverage and Exposure","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-07T00:59:56.532100Z"},"links":{"citing_paper":"/paper/2506.12278"},"observation_digest":"sha256:2e7f3d87271ab4d7f0ea10d37174cb08d154899009a2c0d2b2500c167490b218","observation_id":"810dafbc-04e9-4c04-99f7-dc9cec0e641b","resolution":{"observed_at":"2026-08-07T00:59:57.722344Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.19786","last_updated":"2025-03-25T15:52:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-25T15:52:34Z","title":"Gemma 3 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.19786","snapshot_observed_at":"2026-08-07T00:59:56.591993Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.12278","last_updated":"2025-06-13T23:56:17Z","snapshot_observed_at":"2026-08-10T22:43:56.916807Z","submitted_at":"2025-06-13T23:56:17Z","title":"Can LLMs Generate High-Quality Test Cases for Algorithm Problems? TestCase-Eval: A Systematic Evaluation of Fault Coverage and Exposure","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-07T00:59:56.591993Z"},"links":{"cited_paper":"/paper/2503.19786","citing_paper":"/paper/2506.12278"},"observation_digest":"sha256:22def6cc9b8b14bb6e373251629fd834e97c3d8a2da9ce47b379a38b91d4beec","observation_id":"b5959592-d82d-4bd1-9378-89fa9519ac30","resolution":{"observed_at":"2026-08-07T00:59:56.591993Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:59:57.527032Z","title":null,"venue":null,"work_id":"b5ad20d9-b611-427d-a683-2fcd2b18fff8","year":2024},"citing_paper":{"arxiv_id":"2506.12278","last_updated":"2025-06-13T23:56:17Z","snapshot_observed_at":"2026-08-10T22:43:56.916807Z","submitted_at":"2025-06-13T23:56:17Z","title":"Can LLMs Generate High-Quality Test Cases for Algorithm Problems? TestCase-Eval: A Systematic Evaluation of Fault Coverage and Exposure","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-07T00:59:56.648323Z"},"links":{"citing_paper":"/paper/2506.12278"},"observation_digest":"sha256:b5825e165994af2e2d6f95850dfa977a05d970f451e2e8c2258021785888453c","observation_id":"4cf7ca66-c79b-4ff0-9773-ddb70e485aa2","resolution":{"observed_at":"2026-08-07T00:59:57.569425Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:59:56.704854Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.12278","last_updated":"2025-06-13T23:56:17Z","snapshot_observed_at":"2026-08-10T22:43:56.916807Z","submitted_at":"2025-06-13T23:56:17Z","title":"Can LLMs Generate High-Quality Test Cases for Algorithm Problems? TestCase-Eval: A Systematic Evaluation of Fault Coverage and Exposure","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-07T00:59:56.704854Z"},"links":{"citing_paper":"/paper/2506.12278"},"observation_digest":"sha256:5ed3639e7579ee2d11efa3f4bb459ad4d943673b103221b61c6bdc329279b5ee","observation_id":"e6092ee4-0bcb-4b59-9662-6d0b599e2ddb","resolution":{"observed_at":"2026-08-07T00:59:56.704854Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04531","last_updated":"2025-02-01T08:28:28Z","snapshot_observed_at":"2026-08-16T13:45:20.623404Z","submitted_at":"2024-06-06T22:07:50Z","title":"TESTEVAL: Benchmarking Large Language Models for Test Case Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.04531","snapshot_observed_at":"2026-08-07T00:59:56.751560Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.12278","last_updated":"2025-06-13T23:56:17Z","snapshot_observed_at":"2026-08-10T22:43:56.916807Z","submitted_at":"2025-06-13T23:56:17Z","title":"Can LLMs Generate High-Quality Test Cases for Algorithm Problems? TestCase-Eval: A Systematic Evaluation of Fault Coverage and Exposure","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-07T00:59:56.751560Z"},"links":{"cited_paper":"/paper/2406.04531","citing_paper":"/paper/2506.12278"},"observation_digest":"sha256:8cac2c0c3e480805053c5787b4283c8ddea706e26dd5f67781f3b9b3388bcd2b","observation_id":"572a3131-a99b-4f23-952b-17e21831f1ab","resolution":{"observed_at":"2026-08-07T00:59:56.751560Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-08-07T00:59:56.812729Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.12278","last_updated":"2025-06-13T23:56:17Z","snapshot_observed_at":"2026-08-10T22:43:56.916807Z","submitted_at":"2025-06-13T23:56:17Z","title":"Can LLMs Generate High-Quality Test Cases for Algorithm Problems? TestCase-Eval: A Systematic Evaluation of Fault Coverage and Exposure","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-07T00:59:56.812729Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2506.12278"},"observation_digest":"sha256:dc67e6fd9ed56865de7e59176e8f2939ab4865cb13ccf30954c051ec013c8a50","observation_id":"82778f0a-c4d0-4191-882f-3d21a15b90c5","resolution":{"observed_at":"2026-08-07T00:59:56.812729Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.10671","last_updated":"2024-09-10T13:25:53Z","snapshot_observed_at":"2026-08-17T11:08:48.802438Z","submitted_at":"2024-07-15T12:35:42Z","title":"Qwen2 Technical Report","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.10671","snapshot_observed_at":"2026-08-07T00:59:56.888058Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.12278","last_updated":"2025-06-13T23:56:17Z","snapshot_observed_at":"2026-08-10T22:43:56.916807Z","submitted_at":"2025-06-13T23:56:17Z","title":"Can LLMs Generate High-Quality Test Cases for Algorithm Problems? TestCase-Eval: A Systematic Evaluation of Fault Coverage and Exposure","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-07T00:59:56.888058Z"},"links":{"cited_paper":"/paper/2407.10671","citing_paper":"/paper/2506.12278"},"observation_digest":"sha256:cd825ab9b20d2b8cbb32622bfe5d2b76d88e689d6d4b27b049861eaac2093d2d","observation_id":"037b10f5-6452-4d97-8b18-524b3ee79a94","resolution":{"observed_at":"2026-08-07T00:59:56.888058Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-08-17T18:50:07.059564Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15115","snapshot_observed_at":"2026-08-07T00:59:56.935507Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.12278","last_updated":"2025-06-13T23:56:17Z","snapshot_observed_at":"2026-08-10T22:43:56.916807Z","submitted_at":"2025-06-13T23:56:17Z","title":"Can LLMs Generate High-Quality Test Cases for Algorithm Problems? TestCase-Eval: A Systematic Evaluation of Fault Coverage and Exposure","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-07T00:59:56.935507Z"},"links":{"cited_paper":"/paper/2412.15115","citing_paper":"/paper/2506.12278"},"observation_digest":"sha256:22539147332554ba61cf38b339aeea19c880d613a72ef6b87167586913345f10","observation_id":"4d7f9b05-be02-4689-b1e4-4e1934392f1d","resolution":{"observed_at":"2026-08-07T00:59:56.935507Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.21199","last_updated":"2024-12-31T08:20:42Z","snapshot_observed_at":"2026-08-12T23:35:38.017550Z","submitted_at":"2024-12-30T18:58:58Z","title":"HumanEval Pro and MBPP Pro: Evaluating Large Language Models on Self-invoking Code Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.21199","snapshot_observed_at":"2026-08-07T00:59:57.050750Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.12278","last_updated":"2025-06-13T23:56:17Z","snapshot_observed_at":"2026-08-10T22:43:56.916807Z","submitted_at":"2025-06-13T23:56:17Z","title":"Can LLMs Generate High-Quality Test Cases for Algorithm Problems? TestCase-Eval: A Systematic Evaluation of Fault Coverage and Exposure","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-07T00:59:57.050750Z"},"links":{"cited_paper":"/paper/2412.21199","citing_paper":"/paper/2506.12278"},"observation_digest":"sha256:cabcaf5dfb385b64a0cfd0c4867ff12f2579006a9752d00b35e1c168db98a51b","observation_id":"87e3b6f0-bf66-4c79-a1bc-9e4cc155d542","resolution":{"observed_at":"2026-08-07T00:59:57.050750Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:59:57.404968Z","title":null,"venue":null,"work_id":"909e2709-77cd-488a-b4f4-a6e239d41d00","year":2025},"citing_paper":{"arxiv_id":"2506.12278","last_updated":"2025-06-13T23:56:17Z","snapshot_observed_at":"2026-08-10T22:43:56.916807Z","submitted_at":"2025-06-13T23:56:17Z","title":"Can LLMs Generate High-Quality Test Cases for Algorithm Problems? TestCase-Eval: A Systematic Evaluation of Fault Coverage and Exposure","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-07T00:59:57.100392Z"},"links":{"citing_paper":"/paper/2506.12278"},"observation_digest":"sha256:cef1454566ea0b55e609cb754d17f698d124eb29cdf26b00b4ad908318f66eca","observation_id":"7f58fb4c-a7b5-49c2-a05d-1aa415111917","resolution":{"observed_at":"2026-08-07T00:59:57.459436Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.14591","last_updated":"2023-12-08T00:12:58Z","snapshot_observed_at":"2026-08-18T09:52:48.662709Z","submitted_at":"2023-05-24T00:10:15Z","title":"ALGO: Synthesizing Algorithmic Programs with LLM-Generated Oracle Verifiers","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.14591","snapshot_observed_at":"2026-08-07T00:59:57.155640Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.12278","last_updated":"2025-06-13T23:56:17Z","snapshot_observed_at":"2026-08-10T22:43:56.916807Z","submitted_at":"2025-06-13T23:56:17Z","title":"Can LLMs Generate High-Quality Test Cases for Algorithm Problems? TestCase-Eval: A Systematic Evaluation of Fault Coverage and Exposure","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-07T00:59:57.155640Z"},"links":{"cited_paper":"/paper/2305.14591","citing_paper":"/paper/2506.12278"},"observation_digest":"sha256:cb8a8ef8356bb9343f28de13ebd5bd8594d930e107415ecdab367c51bd8150dc","observation_id":"96f2f7ac-5c99-4447-b9bd-70e4f8488d2b","resolution":{"observed_at":"2026-08-07T00:59:57.155640Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2506.12278","last_updated":"2025-06-13T23:56:17Z","latest_version":1,"primary_category":"cs.SE","snapshot_observed_at":"2026-08-10T22:43:56.916807Z","submitted_at":"2025-06-13T23:56:17Z","title":"Can LLMs Generate High-Quality Test Cases for Algorithm Problems? TestCase-Eval: A Systematic Evaluation of Fault Coverage and Exposure"},"reference_resolution":{"displayed":32,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":32,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":32},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"thesis":"As of 20 August 2026, this Paper Citation Record lists 32 of 32 outbound references and 1 inbound Pith citation observation for arXiv:2506.12278."}