{"as_of":"2026-08-14T07:11:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:cdf58e07da8763eff222dadfaa54043f9a385df331b8cf25d892c7e9a0791e64","coverage":[{"denominator":45,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":45,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T23:42:26.129442Z","state":"measured"},{"denominator":47,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":47,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-14T06:32:32.682623+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T14:15:51.646014Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-19T11:07:15.212042Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2502.08806","last_updated":"2025-02-12T21:42:56Z","snapshot_observed_at":"2026-08-13T06:22:06.396156Z","submitted_at":"2025-02-12T21:42:56Z","title":"CLOVER: A Test Case Generation Benchmark with Coverage, Long-Context, and Verification","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.08806","snapshot_observed_at":"2026-08-07T14:15:51.646014Z","title":"Clover: A test case generation benchmark with coverage, long- context, and verification,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.19443","last_updated":"2025-05-26T03:00:21Z","snapshot_observed_at":"2026-08-07T14:11:48.229560Z","submitted_at":"2025-05-26T03:00:21Z","title":"Vibe Coding vs. Agentic Coding: Fundamentals and Practical Implications of Agentic AI","version":1},"reference_index":209,"source":"pdf_text","source_observed_at":"2026-08-07T14:15:51.646014Z"},"links":{"cited_paper":"/paper/2502.08806","citing_paper":"/paper/2505.19443"},"observation_digest":"sha256:a514a9d0eb4f1a870cb27639c786745b8a6b0ca6d18ae3b310bb48bd0c96607e","observation_id":"b0f194d3-517d-42d2-b2ed-3996b777a5ec","resolution":{"observed_at":"2026-08-07T14:15:51.646014Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.08806","last_updated":"2025-02-12T21:42:56Z","snapshot_observed_at":"2026-08-13T06:22:06.396156Z","submitted_at":"2025-02-12T21:42:56Z","title":"CLOVER: A Test Case Generation Benchmark with Coverage, Long-Context, and Verification","version":1},"cited_work":{"arxiv_id":"2502.08806","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.08806","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Clover: A test case generation benchmark with coverage, long-context, and verification","venue":null,"work_id":"a62ea977-bd75-4bc1-bb3b-d23bab6d7034","year":2025},"citing_paper":{"arxiv_id":"2506.02954","last_updated":"2026-04-15T23:50:31Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-03T14:47:22Z","title":"Mutation-Guided Unit Test Generation with a Large Language Model","version":8},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-05-19T11:05:15.898419Z"},"links":{"cited_paper":"/paper/2502.08806","citing_paper":"/paper/2506.02954"},"observation_digest":"sha256:8c96bf31f2d5ae20926c8bec493de4bdbed749886606101b0ef8abe127ce93dd","observation_id":"49ea228e-2a51-4dcc-b708-6a6263debd60","resolution":{"observed_at":"2026-05-19T11:07:15.213581Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2502.08806/citation-record","integrity":"/paper/2502.08806/integrity","json":"/paper/2502.08806/citation-record.json","paper":"/paper/2502.08806"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:42:25.911052Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.08806","last_updated":"2025-02-12T21:42:56Z","snapshot_observed_at":"2026-08-13T06:22:06.396156Z","submitted_at":"2025-02-12T21:42:56Z","title":"CLOVER: A Test Case Generation Benchmark with Coverage, Long-Context, and Verification","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-07T23:42:25.911052Z"},"links":{"citing_paper":"/paper/2502.08806"},"observation_digest":"sha256:61cc5d9482a2511c89579e469676a45cddf351f1bc664a58e3d2c2deea7b4d0e","observation_id":"72508f8d-9e5d-48d8-a654-45ef9a705f8d","resolution":{"observed_at":"2026-08-07T23:42:25.911052Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:42:26.878661Z","title":"Meet yi-coder: A small but mighty llm for code, September 2024","venue":null,"work_id":"4bc9f3dd-e591-4b82-8405-88b920349380","year":2024},"citing_paper":{"arxiv_id":"2502.08806","last_updated":"2025-02-12T21:42:56Z","snapshot_observed_at":"2026-08-13T06:22:06.396156Z","submitted_at":"2025-02-12T21:42:56Z","title":"CLOVER: A Test Case Generation Benchmark with Coverage, Long-Context, and Verification","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-07T23:42:25.916747Z"},"links":{"citing_paper":"/paper/2502.08806"},"observation_digest":"sha256:2f8deb6fe984984b48cdf2115f9ddb4f0aa8b552c84d9405d05d7b15e54f37c3","observation_id":"59a9ffb5-0749-407a-ad4a-cc560e5de77f","resolution":{"observed_at":"2026-08-07T23:42:26.884315Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:42:26.859878Z","title":"Automated unit test improvement using large language models at meta","venue":null,"work_id":"477db55b-03b8-475e-8af1-02353a5e09ce","year":2024},"citing_paper":{"arxiv_id":"2502.08806","last_updated":"2025-02-12T21:42:56Z","snapshot_observed_at":"2026-08-13T06:22:06.396156Z","submitted_at":"2025-02-12T21:42:56Z","title":"CLOVER: A Test Case Generation Benchmark with Coverage, Long-Context, and Verification","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-07T23:42:25.922104Z"},"links":{"citing_paper":"/paper/2502.08806"},"observation_digest":"sha256:b6bbcc4a2ecad6da4579dd124e7fe932ea8893fb452ba0682771e18bd877a3af","observation_id":"6e2c432d-aec1-443f-b814-def1994e424a","resolution":{"observed_at":"2026-08-07T23:42:26.865696Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2108.07732","last_updated":"2021-08-16T03:57:30Z","snapshot_observed_at":"2026-08-02T19:23:53.535075Z","submitted_at":"2021-08-16T03:57:30Z","title":"Program Synthesis with Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2108.07732","snapshot_observed_at":"2026-08-07T23:42:25.932738Z","title":"Program synthesis with large language models","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.08806","last_updated":"2025-02-12T21:42:56Z","snapshot_observed_at":"2026-08-13T06:22:06.396156Z","submitted_at":"2025-02-12T21:42:56Z","title":"CLOVER: A Test Case Generation Benchmark with Coverage, Long-Context, and Verification","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-07T23:42:25.932738Z"},"links":{"cited_paper":"/paper/2108.07732","citing_paper":"/paper/2502.08806"},"observation_digest":"sha256:fa1eea8d2d494d5e4f41f52033fca3b9ce35db15da53a93092537079f50144bf","observation_id":"5ac23173-e0fc-479c-8440-c21d548a7c5c","resolution":{"observed_at":"2026-08-07T23:42:25.932738Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.07440","last_updated":"2024-09-11T17:37:48Z","snapshot_observed_at":"2026-08-13T22:20:18.011644Z","submitted_at":"2024-09-11T17:37:48Z","title":"SUPER: Evaluating Agents on Setting Up and Executing Tasks from Research Repositories","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.07440","snapshot_observed_at":"2026-08-07T23:42:25.937607Z","title":"Super: Evaluating agents on setting up and executing tasks from research repositories, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.08806","last_updated":"2025-02-12T21:42:56Z","snapshot_observed_at":"2026-08-13T06:22:06.396156Z","submitted_at":"2025-02-12T21:42:56Z","title":"CLOVER: A Test Case Generation Benchmark with Coverage, Long-Context, and Verification","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-07T23:42:25.937607Z"},"links":{"cited_paper":"/paper/2409.07440","citing_paper":"/paper/2502.08806"},"observation_digest":"sha256:8728e1a36cc934eade63d864d5c6486c60b24f41c4edcbafff4fef96185f8166","observation_id":"a1117347-4f56-4fae-a840-11073f52d909","resolution":{"observed_at":"2026-08-07T23:42:25.937607Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2107.03374","last_updated":"2021-07-14T17:16:02Z","snapshot_observed_at":"2026-08-08T11:58:24.516369Z","submitted_at":"2021-07-07T17:41:24Z","title":"Evaluating Large Language Models Trained on Code","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2107.03374","snapshot_observed_at":"2026-08-07T23:42:25.943684Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.08806","last_updated":"2025-02-12T21:42:56Z","snapshot_observed_at":"2026-08-13T06:22:06.396156Z","submitted_at":"2025-02-12T21:42:56Z","title":"CLOVER: A Test Case Generation Benchmark with Coverage, Long-Context, and Verification","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-07T23:42:25.943684Z"},"links":{"cited_paper":"/paper/2107.03374","citing_paper":"/paper/2502.08806"},"observation_digest":"sha256:6e3585941a39641ae319de5457f65c5c8c596cc3204852c0e0e540d6e5a5ab0c","observation_id":"c727c863-dc46-4ced-8d4b-0a7601781bb1","resolution":{"observed_at":"2026-08-07T23:42:25.943684Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:42:26.840671Z","title":"Chatunitest: A framework for llm-based test generation","venue":null,"work_id":"0cd7151e-459a-406d-82b2-8682cc028512","year":2024},"citing_paper":{"arxiv_id":"2502.08806","last_updated":"2025-02-12T21:42:56Z","snapshot_observed_at":"2026-08-13T06:22:06.396156Z","submitted_at":"2025-02-12T21:42:56Z","title":"CLOVER: A Test Case Generation Benchmark with Coverage, Long-Context, and Verification","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-07T23:42:25.950223Z"},"links":{"citing_paper":"/paper/2502.08806"},"observation_digest":"sha256:7d7e84079c6117721d81285af49de462038ef2abe9036076c621b256ac3cfc3d","observation_id":"11bf096e-82e7-4a34-82db-eeb1e0729128","resolution":{"observed_at":"2026-08-07T23:42:26.847564Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-13T17:20:44.002518Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-07T23:42:25.955275Z","title":"The llama 3 herd of models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.08806","last_updated":"2025-02-12T21:42:56Z","snapshot_observed_at":"2026-08-13T06:22:06.396156Z","submitted_at":"2025-02-12T21:42:56Z","title":"CLOVER: A Test Case Generation Benchmark with Coverage, Long-Context, and Verification","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-07T23:42:25.955275Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2502.08806"},"observation_digest":"sha256:d604b4fa60cef3c0d32b11ad8418f14b384abd01b766d7e5d4ecff7c9d9ba750","observation_id":"0c3a9b8a-0fdf-49f5-ab12-dc7e5a6c356a","resolution":{"observed_at":"2026-08-07T23:42:25.955275Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:42:26.823901Z","title":"J., Solar-Lezama, A., Synnaeve, G., and Wang, S","venue":null,"work_id":"eb84d770-a473-477b-8fae-2099b992ed45","year":2024},"citing_paper":{"arxiv_id":"2502.08806","last_updated":"2025-02-12T21:42:56Z","snapshot_observed_at":"2026-08-13T06:22:06.396156Z","submitted_at":"2025-02-12T21:42:56Z","title":"CLOVER: A Test Case Generation Benchmark with Coverage, Long-Context, and Verification","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-07T23:42:25.961583Z"},"links":{"citing_paper":"/paper/2502.08806"},"observation_digest":"sha256:b3add6b90eec51e661d833c0dbf31ad307f26dce8b5f1909f53c325c544e627f","observation_id":"f00f1729-beac-4e59-aa60-f4ca89391bea","resolution":{"observed_at":"2026-08-07T23:42:26.829220Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.06654","last_updated":"2024-08-06T21:48:58Z","snapshot_observed_at":"2026-08-13T23:49:37.850853Z","submitted_at":"2024-04-09T23:41:27Z","title":"RULER: What's the Real Context Size of Your Long-Context Language Models?","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.06654","snapshot_observed_at":"2026-08-07T23:42:25.967351Z","title":"Ruler: What's the real context size of your long-context language models? arXiv preprint arXiv:2404.06654, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.08806","last_updated":"2025-02-12T21:42:56Z","snapshot_observed_at":"2026-08-13T06:22:06.396156Z","submitted_at":"2025-02-12T21:42:56Z","title":"CLOVER: A Test Case Generation Benchmark with Coverage, Long-Context, and Verification","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-07T23:42:25.967351Z"},"links":{"cited_paper":"/paper/2404.06654","citing_paper":"/paper/2502.08806"},"observation_digest":"sha256:af7359a419f371147cab2e50955c0761f39889b6b755ae1625e34d8b57902f9e","observation_id":"5a0071db-f569-4db8-a768-54b587d05402","resolution":{"observed_at":"2026-08-07T23:42:25.967351Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12186","last_updated":"2024-11-12T13:24:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-18T17:57:57Z","title":"Qwen2.5-Coder Technical Report","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12186","snapshot_observed_at":"2026-08-07T23:42:25.973919Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.08806","last_updated":"2025-02-12T21:42:56Z","snapshot_observed_at":"2026-08-13T06:22:06.396156Z","submitted_at":"2025-02-12T21:42:56Z","title":"CLOVER: A Test Case Generation Benchmark with Coverage, Long-Context, and Verification","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-07T23:42:25.973919Z"},"links":{"cited_paper":"/paper/2409.12186","citing_paper":"/paper/2502.08806"},"observation_digest":"sha256:e4f36d476e5791512ec226eb03ee9d18e9f520739bde29ead57b430e1f6cfa46","observation_id":"76019898-5ee3-4a2f-aef5-5a40cd48e651","resolution":{"observed_at":"2026-08-07T23:42:25.973919Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.00752","last_updated":"2025-03-18T19:50:04Z","snapshot_observed_at":"2026-08-13T08:47:19.865949Z","submitted_at":"2024-10-01T14:47:05Z","title":"TestGenEval: A Real World Unit Test Generation and Test Completion Benchmark","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.00752","snapshot_observed_at":"2026-08-07T23:42:25.979207Z","title":"Testgeneval: A real world unit test generation and test completion benchmark, 2024 a","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.08806","last_updated":"2025-02-12T21:42:56Z","snapshot_observed_at":"2026-08-13T06:22:06.396156Z","submitted_at":"2025-02-12T21:42:56Z","title":"CLOVER: A Test Case Generation Benchmark with Coverage, Long-Context, and Verification","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-07T23:42:25.979207Z"},"links":{"cited_paper":"/paper/2410.00752","citing_paper":"/paper/2502.08806"},"observation_digest":"sha256:c339e85bab06d53b3b684e80a2ac8ff2fde0cf6b2b4393af90f473f553c042f6","observation_id":"8a0d8b4d-4b60-4060-812c-68bf083baa74","resolution":{"observed_at":"2026-08-07T23:42:25.979207Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:42:26.807437Z","title":"R2e: Turning any github repository into a programming agent environment","venue":null,"work_id":"e57a7f06-7f36-4eb3-aba7-a5abc5f11296","year":2024},"citing_paper":{"arxiv_id":"2502.08806","last_updated":"2025-02-12T21:42:56Z","snapshot_observed_at":"2026-08-13T06:22:06.396156Z","submitted_at":"2025-02-12T21:42:56Z","title":"CLOVER: A Test Case Generation Benchmark with Coverage, Long-Context, and Verification","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-07T23:42:25.983973Z"},"links":{"citing_paper":"/paper/2502.08806"},"observation_digest":"sha256:6077778efc49f88494948355336e9a860f6115aa8a79b801f71491dbc0d9e08d","observation_id":"39280e94-d9e8-4317-8c25-95325e37cd88","resolution":{"observed_at":"2026-08-07T23:42:26.812790Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06825","last_updated":"2023-10-10T17:54:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-10T17:54:58Z","title":"Mistral 7B","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06825","snapshot_observed_at":"2026-08-07T23:42:25.989171Z","title":"Q., Sablayrolles, A., Mensch, A., Bamford, C., Chaplot, D","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.08806","last_updated":"2025-02-12T21:42:56Z","snapshot_observed_at":"2026-08-13T06:22:06.396156Z","submitted_at":"2025-02-12T21:42:56Z","title":"CLOVER: A Test Case Generation Benchmark with Coverage, Long-Context, and Verification","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-07T23:42:25.989171Z"},"links":{"cited_paper":"/paper/2310.06825","citing_paper":"/paper/2502.08806"},"observation_digest":"sha256:493fdf7a4a0a9b2fde7ff498ac90bea694461de8824171a3853f9dadeb9b60d5","observation_id":"3c52b8d0-6faf-4328-8305-9786ea340128","resolution":{"observed_at":"2026-08-07T23:42:25.989171Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:42:25.993554Z","title":"E., Yang, J., Wettig, A., Yao, S., Pei, K., Press, O., and Narasimhan, K","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.08806","last_updated":"2025-02-12T21:42:56Z","snapshot_observed_at":"2026-08-13T06:22:06.396156Z","submitted_at":"2025-02-12T21:42:56Z","title":"CLOVER: A Test Case Generation Benchmark with Coverage, Long-Context, and Verification","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-07T23:42:25.993554Z"},"links":{"citing_paper":"/paper/2502.08806"},"observation_digest":"sha256:1bf7412286e82caf25afd9181ac3f86586485d2bd2875cc32ae27d4ce458e426","observation_id":"dab75f0b-a11f-4a61-bcd0-f85002560361","resolution":{"observed_at":"2026-08-07T23:42:25.993554Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:42:25.997783Z","title":"H., Gonzalez, J","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.08806","last_updated":"2025-02-12T21:42:56Z","snapshot_observed_at":"2026-08-13T06:22:06.396156Z","submitted_at":"2025-02-12T21:42:56Z","title":"CLOVER: A Test Case Generation Benchmark with Coverage, Long-Context, and Verification","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-07T23:42:25.997783Z"},"links":{"citing_paper":"/paper/2502.08806"},"observation_digest":"sha256:83b687b01a33e3f48b0cda797c4293b9c4d3b075b638a9b803fbc8599d516154","observation_id":"353b2418-6069-463d-94b7-ad2b24a93276","resolution":{"observed_at":"2026-08-07T23:42:25.997783Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.11501","last_updated":"2022-11-18T17:20:27Z","snapshot_observed_at":"2026-08-13T13:39:32.091821Z","submitted_at":"2022-11-18T17:20:27Z","title":"DS-1000: A Natural and Reliable Benchmark for Data Science Code Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.11501","snapshot_observed_at":"2026-08-07T23:42:26.002175Z","title":"Ds-1000: A natural and reliable benchmark for data science code generation","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.08806","last_updated":"2025-02-12T21:42:56Z","snapshot_observed_at":"2026-08-13T06:22:06.396156Z","submitted_at":"2025-02-12T21:42:56Z","title":"CLOVER: A Test Case Generation Benchmark with Coverage, Long-Context, and Verification","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-07T23:42:26.002175Z"},"links":{"cited_paper":"/paper/2211.11501","citing_paper":"/paper/2502.08806"},"observation_digest":"sha256:fe707a3d1246755067bdc486408415de639c280945d29d6ce9c99115b15b30aa","observation_id":"70e2a6cb-7983-4afc-848a-dce358d2c171","resolution":{"observed_at":"2026-08-07T23:42:26.002175Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.08604","last_updated":"2024-12-14T09:45:51Z","snapshot_observed_at":"2026-08-13T00:55:05.388721Z","submitted_at":"2024-03-13T15:13:44Z","title":"Prompting Large Language Models to Tackle the Full Software Development Lifecycle: A Case Study","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.08604","snapshot_observed_at":"2026-08-07T23:42:26.007060Z","title":"Devbench: A comprehensive benchmark for software development, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.08806","last_updated":"2025-02-12T21:42:56Z","snapshot_observed_at":"2026-08-13T06:22:06.396156Z","submitted_at":"2025-02-12T21:42:56Z","title":"CLOVER: A Test Case Generation Benchmark with Coverage, Long-Context, and Verification","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-07T23:42:26.007060Z"},"links":{"cited_paper":"/paper/2403.08604","citing_paper":"/paper/2502.08806"},"observation_digest":"sha256:c1448ed499a93b89ac7e7873b7057b791a6ffdd7b4401cefe51d68a7545d633f","observation_id":"afbbbc1c-2504-4bd4-a9d0-115285ec925d","resolution":{"observed_at":"2026-08-07T23:42:26.007060Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.10304","last_updated":"2025-05-31T10:23:39Z","snapshot_observed_at":"2026-08-13T00:29:23.298016Z","submitted_at":"2024-04-16T06:20:06Z","title":"LLM-Powered Test Case Generation for Detecting Bugs in Plausible Programs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.10304","snapshot_observed_at":"2026-08-07T23:42:26.011395Z","title":"M., Han, Y., Ma, Y., Li, G., and Huang, G","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.08806","last_updated":"2025-02-12T21:42:56Z","snapshot_observed_at":"2026-08-13T06:22:06.396156Z","submitted_at":"2025-02-12T21:42:56Z","title":"CLOVER: A Test Case Generation Benchmark with Coverage, Long-Context, and Verification","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-07T23:42:26.011395Z"},"links":{"cited_paper":"/paper/2404.10304","citing_paper":"/paper/2502.08806"},"observation_digest":"sha256:2ed594c8e0a4370f45383e633544eccd536f6a81a8a53b9c242c79c500f26008","observation_id":"88ed5d32-ead0-458c-bc06-0a49df667072","resolution":{"observed_at":"2026-08-07T23:42:26.011395Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:42:26.769433Z","title":"Repobench: Benchmarking repository-level code auto-completion systems","venue":null,"work_id":"50e20352-1e80-49af-aa61-c891d04f1b39","year":2024},"citing_paper":{"arxiv_id":"2502.08806","last_updated":"2025-02-12T21:42:56Z","snapshot_observed_at":"2026-08-13T06:22:06.396156Z","submitted_at":"2025-02-12T21:42:56Z","title":"CLOVER: A Test Case Generation Benchmark with Coverage, Long-Context, and Verification","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-07T23:42:26.015960Z"},"links":{"citing_paper":"/paper/2502.08806"},"observation_digest":"sha256:8b255e002f4219429a826b4426b8b4f0e813746c8a4bd06048436c328ce0446c","observation_id":"17bfe064-fb3a-4c6e-8e8b-5772ea6976b9","resolution":{"observed_at":"2026-08-07T23:42:26.773987Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.19173","last_updated":"2024-02-29T13:53:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-02-29T13:53:35Z","title":"StarCoder 2 and The Stack v2: The Next Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.19173","snapshot_observed_at":"2026-08-07T23:42:26.019897Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.08806","last_updated":"2025-02-12T21:42:56Z","snapshot_observed_at":"2026-08-13T06:22:06.396156Z","submitted_at":"2025-02-12T21:42:56Z","title":"CLOVER: A Test Case Generation Benchmark with Coverage, Long-Context, and Verification","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-07T23:42:26.019897Z"},"links":{"cited_paper":"/paper/2402.19173","citing_paper":"/paper/2502.08806"},"observation_digest":"sha256:376f31e6adcebd702b56d03188bf586fee1e02fe260f75667fb14a292723ae1b","observation_id":"c14a6623-d78a-41c4-a5c3-1caf8e0dfdfd","resolution":{"observed_at":"2026-08-07T23:42:26.019897Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:42:26.752345Z","title":"Repoagent: An llm-powered open-source framework for repository-level code documentation generation, 2024","venue":null,"work_id":"ff04e87c-d4af-4ba0-b363-12e96e4218c5","year":2024},"citing_paper":{"arxiv_id":"2502.08806","last_updated":"2025-02-12T21:42:56Z","snapshot_observed_at":"2026-08-13T06:22:06.396156Z","submitted_at":"2025-02-12T21:42:56Z","title":"CLOVER: A Test Case Generation Benchmark with Coverage, Long-Context, and Verification","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-07T23:42:26.024262Z"},"links":{"citing_paper":"/paper/2502.08806"},"observation_digest":"sha256:fc42b4fa04b3fbe17157b5d035deea028b5a01641f1a1eb56e8bede1e77b6878","observation_id":"844921b1-14d3-49ed-8aba-144221a67fca","resolution":{"observed_at":"2026-08-07T23:42:26.759143Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.13521","last_updated":"2024-06-11T15:53:35Z","snapshot_observed_at":"2026-08-13T04:14:01.872737Z","submitted_at":"2024-02-21T04:10:12Z","title":"Test-Driven Development for Code Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.13521","snapshot_observed_at":"2026-08-07T23:42:26.028985Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.08806","last_updated":"2025-02-12T21:42:56Z","snapshot_observed_at":"2026-08-13T06:22:06.396156Z","submitted_at":"2025-02-12T21:42:56Z","title":"CLOVER: A Test Case Generation Benchmark with Coverage, Long-Context, and Verification","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-07T23:42:26.028985Z"},"links":{"cited_paper":"/paper/2402.13521","citing_paper":"/paper/2502.08806"},"observation_digest":"sha256:d82bd179e57682cf66b7cac35e7b9af159a6d7c083e8ccce51a08de2c37d0f93","observation_id":"bd4afb88-4031-41d6-9c6a-e9013809a955","resolution":{"observed_at":"2026-08-07T23:42:26.028985Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.12952","last_updated":"2025-02-07T12:33:06Z","snapshot_observed_at":"2026-08-12T23:40:00.219808Z","submitted_at":"2024-06-18T14:54:37Z","title":"SWT-Bench: Testing and Validating Real-World Bug-Fixes with Code Agents","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.12952","snapshot_observed_at":"2026-08-07T23:42:26.034044Z","title":"N., He, J., and Vechev, M","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.08806","last_updated":"2025-02-12T21:42:56Z","snapshot_observed_at":"2026-08-13T06:22:06.396156Z","submitted_at":"2025-02-12T21:42:56Z","title":"CLOVER: A Test Case Generation Benchmark with Coverage, Long-Context, and Verification","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-07T23:42:26.034044Z"},"links":{"cited_paper":"/paper/2406.12952","citing_paper":"/paper/2502.08806"},"observation_digest":"sha256:5832fc3ea2df4c7776e49a26ec7f0b70f16de81f2caf82b555e9f532d6e938e1","observation_id":"33dee1b0-7eec-4ef4-9ec5-702ca5051ece","resolution":{"observed_at":"2026-08-07T23:42:26.034044Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:42:26.737520Z","title":"J., Mooney, R","venue":null,"work_id":"d4883c08-34bc-448a-a5fe-2c0085b9263b","year":2023},"citing_paper":{"arxiv_id":"2502.08806","last_updated":"2025-02-12T21:42:56Z","snapshot_observed_at":"2026-08-13T06:22:06.396156Z","submitted_at":"2025-02-12T21:42:56Z","title":"CLOVER: A Test Case Generation Benchmark with Coverage, Long-Context, and Verification","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-07T23:42:26.039523Z"},"links":{"citing_paper":"/paper/2502.08806"},"observation_digest":"sha256:7df99c94c8ab6b58153e8a15d1ab8df12a1e287b7037733d8583d0bbc0c9f741","observation_id":"dbdf3b35-4b00-4e88-85b2-685875201fdb","resolution":{"observed_at":"2026-08-07T23:42:26.742372Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:42:26.718932Z","title":"Codegen: An open large language model for code with multi-turn program synthesis","venue":null,"work_id":"1a7b2c21-e8d9-4d66-8a19-0453f137122a","year":2023},"citing_paper":{"arxiv_id":"2502.08806","last_updated":"2025-02-12T21:42:56Z","snapshot_observed_at":"2026-08-13T06:22:06.396156Z","submitted_at":"2025-02-12T21:42:56Z","title":"CLOVER: A Test Case Generation Benchmark with Coverage, Long-Context, and Verification","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-07T23:42:26.044961Z"},"links":{"citing_paper":"/paper/2502.08806"},"observation_digest":"sha256:a70a094498cff5c526ad501ce71f89475c94d63a0abe2bc7b84f9d74c5d4303f","observation_id":"882590d2-6cf7-40ca-bafd-c35a0fc441bd","resolution":{"observed_at":"2026-08-07T23:42:26.724156Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.12950","last_updated":"2024-01-31T19:47:26Z","snapshot_observed_at":"2026-08-13T04:25:38.282910Z","submitted_at":"2023-08-24T17:39:13Z","title":"Code Llama: Open Foundation Models for Code","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.12950","snapshot_observed_at":"2026-08-07T23:42:26.050031Z","title":"E., Adi, Y., Liu, J., Sauvestre, R., Remez, T., et al","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.08806","last_updated":"2025-02-12T21:42:56Z","snapshot_observed_at":"2026-08-13T06:22:06.396156Z","submitted_at":"2025-02-12T21:42:56Z","title":"CLOVER: A Test Case Generation Benchmark with Coverage, Long-Context, and Verification","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-07T23:42:26.050031Z"},"links":{"cited_paper":"/paper/2308.12950","citing_paper":"/paper/2502.08806"},"observation_digest":"sha256:22a793de22342ebff10ae707f33d5dcde43b8156dcedc9f655aff20a60f26826","observation_id":"2855f320-9c19-4666-899b-9579be09bdb7","resolution":{"observed_at":"2026-08-07T23:42:26.050031Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:42:26.703007Z","title":"K., and Ray, B","venue":null,"work_id":"516b29d0-101d-497a-a01f-aa61d76b1a2d","year":2024},"citing_paper":{"arxiv_id":"2502.08806","last_updated":"2025-02-12T21:42:56Z","snapshot_observed_at":"2026-08-13T06:22:06.396156Z","submitted_at":"2025-02-12T21:42:56Z","title":"CLOVER: A Test Case Generation Benchmark with Coverage, Long-Context, and Verification","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-07T23:42:26.054881Z"},"links":{"citing_paper":"/paper/2502.08806"},"observation_digest":"sha256:992353685e3034475d7ab46886c5f71058b2cf5da75ec6a0b83ab961cb4dc154","observation_id":"3afee8b9-c755-4011-a584-e938b40a1248","resolution":{"observed_at":"2026-08-07T23:42:26.707580Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:42:26.687465Z","title":"Chatgpt vs sbst: A comparative assessment of unit test suite generation","venue":null,"work_id":"6176dead-e964-4fff-ab7a-34e41ea8f2e9","year":2024},"citing_paper":{"arxiv_id":"2502.08806","last_updated":"2025-02-12T21:42:56Z","snapshot_observed_at":"2026-08-13T06:22:06.396156Z","submitted_at":"2025-02-12T21:42:56Z","title":"CLOVER: A Test Case Generation Benchmark with Coverage, Long-Context, and Verification","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-07T23:42:26.059574Z"},"links":{"citing_paper":"/paper/2502.08806"},"observation_digest":"sha256:72503bb554edb12f7117185769d2c29d4b14eea0df759dc1f67924a0d7295e7c","observation_id":"e6370a87-6d6d-4315-8da3-7b759ed4a708","resolution":{"observed_at":"2026-08-07T23:42:26.692563Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11409","last_updated":"2024-06-19T02:37:50Z","snapshot_observed_at":"2026-08-12T23:41:14.320216Z","submitted_at":"2024-06-17T10:54:35Z","title":"CodeGemma: Open Code Models Based on Gemma","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.11409","snapshot_observed_at":"2026-08-07T23:42:26.063958Z","title":"A., Shen, J., Kelley, J., et al","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.08806","last_updated":"2025-02-12T21:42:56Z","snapshot_observed_at":"2026-08-13T06:22:06.396156Z","submitted_at":"2025-02-12T21:42:56Z","title":"CLOVER: A Test Case Generation Benchmark with Coverage, Long-Context, and Verification","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-07T23:42:26.063958Z"},"links":{"cited_paper":"/paper/2406.11409","citing_paper":"/paper/2502.08806"},"observation_digest":"sha256:eaad24231ecc43e3549fc712361202a83c01dbddd9c53992da528853de227f97","observation_id":"6c7198a6-20a1-4406-87a8-71f4ebb5d688","resolution":{"observed_at":"2026-08-07T23:42:26.063958Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2009.05617","last_updated":"2021-05-20T23:11:01Z","snapshot_observed_at":"2026-08-14T06:51:15.685219Z","submitted_at":"2020-09-11T18:57:36Z","title":"Unit Test Case Generation with Transformers and Focal Context","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2009.05617","snapshot_observed_at":"2026-08-07T23:42:26.068366Z","title":"K., and Sundaresan, N","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2502.08806","last_updated":"2025-02-12T21:42:56Z","snapshot_observed_at":"2026-08-13T06:22:06.396156Z","submitted_at":"2025-02-12T21:42:56Z","title":"CLOVER: A Test Case Generation Benchmark with Coverage, Long-Context, and Verification","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-07T23:42:26.068366Z"},"links":{"cited_paper":"/paper/2009.05617","citing_paper":"/paper/2502.08806"},"observation_digest":"sha256:5de1fd900e928526947a7cf7f8b2f2c6ad0df827c7dde29d3de9003c355714fb","observation_id":"ebb79ddf-1a70-418f-9f57-6128893ddb9f","resolution":{"observed_at":"2026-08-07T23:42:26.068366Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:42:26.671808Z","title":"Software testing with large language models: Survey, landscape, and vision","venue":null,"work_id":"34444e1d-3942-4b6c-aa81-41132dfadcb2","year":2024},"citing_paper":{"arxiv_id":"2502.08806","last_updated":"2025-02-12T21:42:56Z","snapshot_observed_at":"2026-08-13T06:22:06.396156Z","submitted_at":"2025-02-12T21:42:56Z","title":"CLOVER: A Test Case Generation Benchmark with Coverage, Long-Context, and Verification","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-07T23:42:26.073028Z"},"links":{"citing_paper":"/paper/2502.08806"},"observation_digest":"sha256:60135293608c3a1164c9b9b070dc6a2f95aa2e50e292b9ab1d532e3fb358052d","observation_id":"22702a80-367a-4b74-b60f-c6a8486d71e1","resolution":{"observed_at":"2026-08-07T23:42:26.676989Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04531","last_updated":"2025-02-01T08:28:28Z","snapshot_observed_at":"2026-08-12T23:48:19.158785Z","submitted_at":"2024-06-06T22:07:50Z","title":"TESTEVAL: Benchmarking Large Language Models for Test Case Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.04531","snapshot_observed_at":"2026-08-07T23:42:26.077466Z","title":"R., and Ma, L","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.08806","last_updated":"2025-02-12T21:42:56Z","snapshot_observed_at":"2026-08-13T06:22:06.396156Z","submitted_at":"2025-02-12T21:42:56Z","title":"CLOVER: A Test Case Generation Benchmark with Coverage, Long-Context, and Verification","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-07T23:42:26.077466Z"},"links":{"cited_paper":"/paper/2406.04531","citing_paper":"/paper/2502.08806"},"observation_digest":"sha256:c58feba93fd254314c3309febb1d4967bd776f2518439c6ef84e288a4c740d0e","observation_id":"a243c40a-07ad-4554-8a41-896446ed20d4","resolution":{"observed_at":"2026-08-07T23:42:26.077466Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.16741","last_updated":"2025-04-18T18:14:31Z","snapshot_observed_at":"2026-08-13T15:09:03.002894Z","submitted_at":"2024-07-23T17:50:43Z","title":"OpenHands: An Open Platform for AI Software Developers as Generalist Agents","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.16741","snapshot_observed_at":"2026-08-07T23:42:26.082368Z","title":"F., Tang, X., Zhuge, M., Pan, J., Song, Y., Li, B., Singh, J., Tran, H","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.08806","last_updated":"2025-02-12T21:42:56Z","snapshot_observed_at":"2026-08-13T06:22:06.396156Z","submitted_at":"2025-02-12T21:42:56Z","title":"CLOVER: A Test Case Generation Benchmark with Coverage, Long-Context, and Verification","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-07T23:42:26.082368Z"},"links":{"cited_paper":"/paper/2407.16741","citing_paper":"/paper/2502.08806"},"observation_digest":"sha256:a26f748afaa3326968e2c00adbf13666fa06117254e17ec8e6b2302fea5a576d","observation_id":"fd712e2f-d0d7-419b-aa5f-e44a6811fb86","resolution":{"observed_at":"2026-08-07T23:42:26.082368Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:42:26.652680Z","title":"Magicoder: Empowering code generation with OSS -instruct","venue":null,"work_id":"69720e05-1eaa-46ab-b7d0-43ad56b29624","year":2024},"citing_paper":{"arxiv_id":"2502.08806","last_updated":"2025-02-12T21:42:56Z","snapshot_observed_at":"2026-08-13T06:22:06.396156Z","submitted_at":"2025-02-12T21:42:56Z","title":"CLOVER: A Test Case Generation Benchmark with Coverage, Long-Context, and Verification","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-07T23:42:26.086937Z"},"links":{"citing_paper":"/paper/2502.08806"},"observation_digest":"sha256:96f49732b42ba3786681430b17f9f47d773c2877f14eef847e3bbad644a8a761","observation_id":"291a2922-1a84-4014-aa9b-5c207b23db5a","resolution":{"observed_at":"2026-08-07T23:42:26.659141Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15115","snapshot_observed_at":"2026-08-07T23:42:26.091037Z","title":"Qwen2.5 technical report","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.08806","last_updated":"2025-02-12T21:42:56Z","snapshot_observed_at":"2026-08-13T06:22:06.396156Z","submitted_at":"2025-02-12T21:42:56Z","title":"CLOVER: A Test Case Generation Benchmark with Coverage, Long-Context, and Verification","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-07T23:42:26.091037Z"},"links":{"cited_paper":"/paper/2412.15115","citing_paper":"/paper/2502.08806"},"observation_digest":"sha256:b0f2eb117ed198f6ed22a19dc9a988a871ce3134ad50dde90e785895c1b8683b","observation_id":"f5a13ddf-4d83-4ce3-ae3d-4f07f7413dfb","resolution":{"observed_at":"2026-08-07T23:42:26.091037Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:42:26.633880Z","title":"and Liang, P","venue":null,"work_id":"76039859-39e5-443d-a4df-93ee37191206","year":2021},"citing_paper":{"arxiv_id":"2502.08806","last_updated":"2025-02-12T21:42:56Z","snapshot_observed_at":"2026-08-13T06:22:06.396156Z","submitted_at":"2025-02-12T21:42:56Z","title":"CLOVER: A Test Case Generation Benchmark with Coverage, Long-Context, and Verification","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-07T23:42:26.095510Z"},"links":{"citing_paper":"/paper/2502.08806"},"observation_digest":"sha256:ef565a96d9859cba42880871a0898ca2af800f5cb507456fc43332f15083732a","observation_id":"cb309eb7-bd23-453e-81f5-4cad2b614138","resolution":{"observed_at":"2026-08-07T23:42:26.639126Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:42:26.615884Z","title":"and Harman, M","venue":null,"work_id":"ea0c52bc-fbdc-4d1c-89f6-a78acf3ebc12","year":2012},"citing_paper":{"arxiv_id":"2502.08806","last_updated":"2025-02-12T21:42:56Z","snapshot_observed_at":"2026-08-13T06:22:06.396156Z","submitted_at":"2025-02-12T21:42:56Z","title":"CLOVER: A Test Case Generation Benchmark with Coverage, Long-Context, and Verification","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-07T23:42:26.099608Z"},"links":{"citing_paper":"/paper/2502.08806"},"observation_digest":"sha256:da00c37079eefd5fdabf7cce82106d2ebaa71fc021d55cf225f906b9b89c1b23","observation_id":"8ba92b89-6781-4cb0-b05b-f5aedd330860","resolution":{"observed_at":"2026-08-07T23:42:26.621538Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:42:26.597988Z","title":"Evaluating and improving chatgpt for unit test generation","venue":null,"work_id":"4aad696a-ac95-4c2e-9466-f7d0c54b173f","year":2024},"citing_paper":{"arxiv_id":"2502.08806","last_updated":"2025-02-12T21:42:56Z","snapshot_observed_at":"2026-08-13T06:22:06.396156Z","submitted_at":"2025-02-12T21:42:56Z","title":"CLOVER: A Test Case Generation Benchmark with Coverage, Long-Context, and Verification","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-07T23:42:26.103527Z"},"links":{"citing_paper":"/paper/2502.08806"},"observation_digest":"sha256:75dd9189b9e109c6a9c8ee61966d51bac5a77f04704ede9b9be3ccefc30b2e01","observation_id":"28b3986c-117e-4fb5-abf9-4b6ac14657d1","resolution":{"observed_at":"2026-08-07T23:42:26.603549Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.17561","last_updated":"2024-09-26T06:18:06Z","snapshot_observed_at":"2026-08-12T22:37:12.804683Z","submitted_at":"2024-09-26T06:18:06Z","title":"TestBench: Evaluating Class-Level Test Case Generation Capability of Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.17561","snapshot_observed_at":"2026-08-07T23:42:26.107547Z","title":"Testbench: Evaluating class-level test case generation capability of large language models, 2024 a","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.08806","last_updated":"2025-02-12T21:42:56Z","snapshot_observed_at":"2026-08-13T06:22:06.396156Z","submitted_at":"2025-02-12T21:42:56Z","title":"CLOVER: A Test Case Generation Benchmark with Coverage, Long-Context, and Verification","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-07T23:42:26.107547Z"},"links":{"cited_paper":"/paper/2409.17561","citing_paper":"/paper/2502.08806"},"observation_digest":"sha256:4a6ed6aec7b4e95359a113038f49308e74ba00cdd2c6e71970e77bd80ce77320","observation_id":"8be7cd65-24b6-47a7-ae15-563f1939239d","resolution":{"observed_at":"2026-08-07T23:42:26.107547Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:42:26.578887Z","title":"B ench: Extending long context evaluation beyond 100 K tokens","venue":null,"work_id":"a12ffbfd-db50-45b9-a8a4-32bd812a3d76","year":2024},"citing_paper":{"arxiv_id":"2502.08806","last_updated":"2025-02-12T21:42:56Z","snapshot_observed_at":"2026-08-13T06:22:06.396156Z","submitted_at":"2025-02-12T21:42:56Z","title":"CLOVER: A Test Case Generation Benchmark with Coverage, Long-Context, and Verification","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-07T23:42:26.111985Z"},"links":{"citing_paper":"/paper/2502.08806"},"observation_digest":"sha256:d40941779a9a8e1d9648deb01898591300f0659f7828db6f00b785d28ec4e8b7","observation_id":"dd257b3b-4bc3-4ffc-a66b-1c549c8f179a","resolution":{"observed_at":"2026-08-07T23:42:26.587274Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:42:26.563197Z","title":"Y., Vu, M","venue":null,"work_id":"9e7b4800-596d-4b2f-a9f4-8d1a6125306d","year":2024},"citing_paper":{"arxiv_id":"2502.08806","last_updated":"2025-02-12T21:42:56Z","snapshot_observed_at":"2026-08-13T06:22:06.396156Z","submitted_at":"2025-02-12T21:42:56Z","title":"CLOVER: A Test Case Generation Benchmark with Coverage, Long-Context, and Verification","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-07T23:42:26.116342Z"},"links":{"citing_paper":"/paper/2502.08806"},"observation_digest":"sha256:ff584c5d1a185454e4c4c89f363b4168b3113899211194fc7460997d8053bb90","observation_id":"8e74ffd1-4237-4dca-98df-9a1838e9e116","resolution":{"observed_at":"2026-08-07T23:42:26.567859Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:42:26.120518Z","title":"@esa (Ref","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.08806","last_updated":"2025-02-12T21:42:56Z","snapshot_observed_at":"2026-08-13T06:22:06.396156Z","submitted_at":"2025-02-12T21:42:56Z","title":"CLOVER: A Test Case Generation Benchmark with Coverage, Long-Context, and Verification","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-07T23:42:26.120518Z"},"links":{"citing_paper":"/paper/2502.08806"},"observation_digest":"sha256:9b73ff39e34d38ec76a009f2414d6f068dc157fe48d5668c02bf7928ce6a62e9","observation_id":"bb4fa065-3de2-4d8d-a73b-422b961060e2","resolution":{"observed_at":"2026-08-07T23:42:26.120518Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:42:26.125205Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.08806","last_updated":"2025-02-12T21:42:56Z","snapshot_observed_at":"2026-08-13T06:22:06.396156Z","submitted_at":"2025-02-12T21:42:56Z","title":"CLOVER: A Test Case Generation Benchmark with Coverage, Long-Context, and Verification","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-07T23:42:26.125205Z"},"links":{"citing_paper":"/paper/2502.08806"},"observation_digest":"sha256:97e529ab82a1bbb409e81b53bca670ae99b8c2b8e6b4aef4474f7759397baffc","observation_id":"980300f9-2a1c-41c7-a2b8-410545e523b8","resolution":{"observed_at":"2026-08-07T23:42:26.125205Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:42:26.522833Z","title":"a\") == \"a","venue":null,"work_id":"d02c8963-dea1-4daf-9371-54c61f984f56","year":2024},"citing_paper":{"arxiv_id":"2502.08806","last_updated":"2025-02-12T21:42:56Z","snapshot_observed_at":"2026-08-13T06:22:06.396156Z","submitted_at":"2025-02-12T21:42:56Z","title":"CLOVER: A Test Case Generation Benchmark with Coverage, Long-Context, and Verification","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-07T23:42:26.129442Z"},"links":{"citing_paper":"/paper/2502.08806"},"observation_digest":"sha256:c5fa2fe673cd17ea43dc414e11acb16e03475176fe19d6fda81f2dfc0464776e","observation_id":"829199ae-e796-4229-a703-89a0d9b1c398","resolution":{"observed_at":"2026-08-07T23:42:26.529291Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2502.08806","last_updated":"2025-02-12T21:42:56Z","latest_version":1,"primary_category":"cs.SE","snapshot_observed_at":"2026-08-13T06:22:06.396156Z","submitted_at":"2025-02-12T21:42:56Z","title":"CLOVER: A Test Case Generation Benchmark with Coverage, Long-Context, and Verification"},"reference_resolution":{"displayed":45,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":26,"verified_exact":0,"verified_fuzzy":18},"total_outbound_references":45},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"thesis":"As of 14 August 2026, this Paper Citation Record lists 45 of 45 outbound references and 2 inbound Pith citation observations for arXiv:2502.08806."}