{"as_of":"2026-08-10T09:55:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:4ffd8c985992377f5ccedb6b311f2c9550b56578a7701fb04079090cd5c43afb","coverage":[{"denominator":35,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":35,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T12:39:59.087204Z","state":"measured"},{"denominator":43,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":43,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":8,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":8,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T00:58:27.773874Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T20:00:08.065119Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.24098","last_updated":"2025-05-30T01:00:34Z","snapshot_observed_at":"2026-08-09T17:58:14.173767Z","submitted_at":"2025-05-30T01:00:34Z","title":"HardTests: Synthesizing High-Quality Test Cases for LLM Coding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.24098","snapshot_observed_at":"2026-08-06T00:58:27.773874Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.05686","last_updated":"2025-08-06T05:04:14Z","snapshot_observed_at":"2026-08-09T06:17:59.142056Z","submitted_at":"2025-08-06T05:04:14Z","title":"Efficiency of turbulence","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T00:58:27.773874Z"},"links":{"cited_paper":"/paper/2505.24098","citing_paper":"/paper/2508.05686"},"observation_digest":"sha256:3358f5bb09612161751c0d18ee822cf6569c0e981b176f8ac23048ffb7737ebe","observation_id":"57da5526-4a26-4dbb-8eed-1f45a9385867","resolution":{"observed_at":"2026-08-06T00:58:27.773874Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.24098","last_updated":"2025-05-30T01:00:34Z","snapshot_observed_at":"2026-08-09T17:58:14.173767Z","submitted_at":"2025-05-30T01:00:34Z","title":"HardTests: Synthesizing High-Quality Test Cases for LLM Coding","version":1},"cited_work":{"arxiv_id":"2505.24098","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.24098","snapshot_observed_at":"2026-07-04T20:00:08.065119Z","title":"HardTests: Synthesizing high-quality test cases for LLM coding.arXiv preprint arXiv:2505.24098","venue":null,"work_id":"16dbfd6e-1004-49f1-bb95-3dcc797791f8","year":2025},"citing_paper":{"arxiv_id":"2604.21138","last_updated":"2026-04-22T22:58:47Z","snapshot_observed_at":"2026-07-06T23:07:47.244208Z","submitted_at":"2026-04-22T22:58:47Z","title":"Navigating the Clutter: Waypoint-Based Bi-Level Planning for Multi-Robot Systems","version":1},"reference_index":118,"source":"arxiv_source","source_observed_at":"2026-05-09T23:27:54.704794Z"},"links":{"cited_paper":"/paper/2505.24098","citing_paper":"/paper/2604.21138"},"observation_digest":"sha256:771cefd7dee2f90f9c660a5f88f075558268dfd7f29577bd0e076a8f372d6fc5","observation_id":"bb1423bc-89a7-4034-949f-64dd43891641","resolution":{"observed_at":"2026-05-11T14:06:05.487820Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.24098","last_updated":"2025-05-30T01:00:34Z","snapshot_observed_at":"2026-08-09T17:58:14.173767Z","submitted_at":"2025-05-30T01:00:34Z","title":"HardTests: Synthesizing High-Quality Test Cases for LLM Coding","version":1},"cited_work":{"arxiv_id":"2505.24098","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.24098","snapshot_observed_at":"2026-07-04T20:00:08.065119Z","title":"HardTests: Synthesizing high-quality test cases for LLM coding.arXiv preprint arXiv:2505.24098","venue":null,"work_id":"16dbfd6e-1004-49f1-bb95-3dcc797791f8","year":2025},"citing_paper":{"arxiv_id":"2605.08553","last_updated":"2026-05-08T23:25:05Z","snapshot_observed_at":"2026-07-06T23:20:47.880233Z","submitted_at":"2026-05-08T23:25:05Z","title":"VeriContest: A Competitive-Programming Benchmark for Verifiable Code Generation","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-12T01:21:42.562823Z"},"links":{"cited_paper":"/paper/2505.24098","citing_paper":"/paper/2605.08553"},"observation_digest":"sha256:8e67f8d7c8ecb071dec9a21f878745f4052b8ce9c00f082352444f4585c910c2","observation_id":"02a07b45-6973-4a29-84d8-0db561655f4d","resolution":{"observed_at":"2026-05-12T08:01:32.448442Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.24098","last_updated":"2025-05-30T01:00:34Z","snapshot_observed_at":"2026-08-09T17:58:14.173767Z","submitted_at":"2025-05-30T01:00:34Z","title":"HardTests: Synthesizing High-Quality Test Cases for LLM Coding","version":1},"cited_work":{"arxiv_id":"2505.24098","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.24098","snapshot_observed_at":"2026-07-04T20:00:08.065119Z","title":"HardTests: Synthesizing high-quality test cases for LLM coding.arXiv preprint arXiv:2505.24098","venue":null,"work_id":"16dbfd6e-1004-49f1-bb95-3dcc797791f8","year":2025},"citing_paper":{"arxiv_id":"2605.14445","last_updated":"2026-05-14T06:39:42Z","snapshot_observed_at":"2026-08-01T15:27:40.908509Z","submitted_at":"2026-05-14T06:39:42Z","title":"FrontierSmith: Synthesizing Open-Ended Coding Problems at Scale","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-15T02:02:25.597640Z"},"links":{"cited_paper":"/paper/2505.24098","citing_paper":"/paper/2605.14445"},"observation_digest":"sha256:d54d7ccb62c099492c41c078c305951f8195a921a1fa9f60e74041173118d884","observation_id":"7f72180a-fb8a-48f2-93ee-2b50f2e2cfc5","resolution":{"observed_at":"2026-05-15T02:03:29.053765Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.24098","last_updated":"2025-05-30T01:00:34Z","snapshot_observed_at":"2026-08-09T17:58:14.173767Z","submitted_at":"2025-05-30T01:00:34Z","title":"HardTests: Synthesizing High-Quality Test Cases for LLM Coding","version":1},"cited_work":{"arxiv_id":"2505.24098","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.24098","snapshot_observed_at":"2026-07-04T20:00:08.065119Z","title":"HardTests: Synthesizing high-quality test cases for LLM coding.arXiv preprint arXiv:2505.24098","venue":null,"work_id":"16dbfd6e-1004-49f1-bb95-3dcc797791f8","year":2025},"citing_paper":{"arxiv_id":"2605.24693","last_updated":"2026-05-23T18:13:41Z","snapshot_observed_at":"2026-08-03T16:34:39.940462Z","submitted_at":"2026-05-23T18:13:41Z","title":"CP-Agent: A Calibrated Risk-Controlled Agent for Feedback-Driven Competitive Programming","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-06-30T13:19:22.541146Z"},"links":{"cited_paper":"/paper/2505.24098","citing_paper":"/paper/2605.24693"},"observation_digest":"sha256:3af1de7ced0840e324864bd61e78f1fcfe47b8133abb10db06f9d022f8e412c6","observation_id":"c6f235e1-2126-485a-a8bb-23a8c8e84267","resolution":{"observed_at":"2026-06-30T13:24:40.201084Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.24098","last_updated":"2025-05-30T01:00:34Z","snapshot_observed_at":"2026-08-09T17:58:14.173767Z","submitted_at":"2025-05-30T01:00:34Z","title":"HardTests: Synthesizing High-Quality Test Cases for LLM Coding","version":1},"cited_work":{"arxiv_id":"2505.24098","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.24098","snapshot_observed_at":"2026-07-04T20:00:08.065119Z","title":"HardTests: Synthesizing high-quality test cases for LLM coding.arXiv preprint arXiv:2505.24098","venue":null,"work_id":"16dbfd6e-1004-49f1-bb95-3dcc797791f8","year":2025},"citing_paper":{"arxiv_id":"2606.25450","last_updated":"2026-06-25T16:37:45Z","snapshot_observed_at":"2026-08-02T04:58:05.165698Z","submitted_at":"2026-06-24T06:26:02Z","title":"The Generalization Spectrum: A Chromatographic Approach to Evaluating Learning Algorithms","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-06-25T20:55:15.784610Z"},"links":{"cited_paper":"/paper/2505.24098","citing_paper":"/paper/2606.25450"},"observation_digest":"sha256:16abb4c288889ec36e9e7a0080f21ab6abd07d3c6230ed122c6ab3f12b714067","observation_id":"99f18f25-3205-49c3-8e8a-86caaa7b88ff","resolution":{"observed_at":"2026-07-04T20:00:08.067026Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.24098","last_updated":"2025-05-30T01:00:34Z","snapshot_observed_at":"2026-08-09T17:58:14.173767Z","submitted_at":"2025-05-30T01:00:34Z","title":"HardTests: Synthesizing High-Quality Test Cases for LLM Coding","version":1},"cited_work":{"arxiv_id":"2505.24098","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.24098","snapshot_observed_at":"2026-07-04T20:00:08.065119Z","title":"HardTests: Synthesizing high-quality test cases for LLM coding.arXiv preprint arXiv:2505.24098","venue":null,"work_id":"16dbfd6e-1004-49f1-bb95-3dcc797791f8","year":2025},"citing_paper":{"arxiv_id":"2606.25450","last_updated":"2026-06-25T16:37:45Z","snapshot_observed_at":"2026-08-02T04:58:05.165698Z","submitted_at":"2026-06-24T06:26:02Z","title":"The Generalization Spectrum: A Chromatographic Approach to Evaluating Learning Algorithms","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-06-26T05:29:21.598397Z"},"links":{"cited_paper":"/paper/2505.24098","citing_paper":"/paper/2606.25450"},"observation_digest":"sha256:6171f723001853a088eef90ab33602cf5a3c0830102dd505bf978375e3b0c6a3","observation_id":"b618dcfd-225a-4794-85de-af1428477042","resolution":{"observed_at":"2026-07-04T13:09:50.596811Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.24098","last_updated":"2025-05-30T01:00:34Z","snapshot_observed_at":"2026-08-09T17:58:14.173767Z","submitted_at":"2025-05-30T01:00:34Z","title":"HardTests: Synthesizing High-Quality Test Cases for LLM Coding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.24098","snapshot_observed_at":"2026-08-04T22:23:16.109674Z","title":"Hardtests: Synthesizing high-quality test cases for llm coding, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.01715","last_updated":"2026-08-03T05:24:03Z","snapshot_observed_at":"2026-08-07T22:47:51.608048Z","submitted_at":"2026-08-03T05:24:03Z","title":"Coding Agents as Test-Suite Auditors: Finding What Official Suites Miss While Approaching What They Catch","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-04T22:23:16.109674Z"},"links":{"cited_paper":"/paper/2505.24098","citing_paper":"/paper/2608.01715"},"observation_digest":"sha256:36b94044477b8640cad205fec94408dcd1b075d2e251c4c1316b4b6daeeeb4a4","observation_id":"0aa7b6c7-458a-4bf8-a924-98bbb9ae9c7b","resolution":{"observed_at":"2026-08-04T22:23:16.109674Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2505.24098/citation-record","integrity":"/paper/2505.24098/integrity","json":"/paper/2505.24098/citation-record.json","paper":"/paper/2505.24098"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:40:00.202694Z","title":"1 1 0\\n1000000000\\n1000000000","venue":null,"work_id":"43a080bc-bcd5-4a07-bcfd-4937c5b34b1b","year":2000},"citing_paper":{"arxiv_id":"2505.24098","last_updated":"2025-05-30T01:00:34Z","snapshot_observed_at":"2026-08-09T17:58:14.173767Z","submitted_at":"2025-05-30T01:00:34Z","title":"HardTests: Synthesizing High-Quality Test Cases for LLM Coding","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T12:39:59.087204Z"},"links":{"citing_paper":"/paper/2505.24098"},"observation_digest":"sha256:8049b5fe7509b3cbb1aac780601d8411efa3c49ac9dba1fd5b9818f4b92c5714","observation_id":"d8a05b95-d4d3-4b7c-b4df-3ee993ddfcb5","resolution":{"observed_at":"2026-08-07T12:40:00.263496Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:40:00.707156Z","title":"123 * The Python code block under each field should be independent","venue":null,"work_id":"c3f6ff64-cee0-47b4-8586-1ed634baa10a","year":2000},"citing_paper":{"arxiv_id":"2505.24098","last_updated":"2025-05-30T01:00:34Z","snapshot_observed_at":"2026-08-09T17:58:14.173767Z","submitted_at":"2025-05-30T01:00:34Z","title":"HardTests: Synthesizing High-Quality Test Cases for LLM Coding","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T12:39:58.827514Z"},"links":{"citing_paper":"/paper/2505.24098"},"observation_digest":"sha256:98201518b88df78457def2b48084876aceb63abe2a6ea1af2036e5afd31b03d5","observation_id":"e799839a-3f33-456d-93ae-86b8d820e280","resolution":{"observed_at":"2026-08-07T12:40:00.825078Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2107.03374","last_updated":"2021-07-14T17:16:02Z","snapshot_observed_at":"2026-08-08T11:58:24.516369Z","submitted_at":"2021-07-07T17:41:24Z","title":"Evaluating Large Language Models Trained on Code","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2107.03374","snapshot_observed_at":"2026-08-07T12:39:55.616900Z","title":"Caia Costello, Simon Guo, Anna Goldie, and Azalia Mirhoseini","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.24098","last_updated":"2025-05-30T01:00:34Z","snapshot_observed_at":"2026-08-09T17:58:14.173767Z","submitted_at":"2025-05-30T01:00:34Z","title":"HardTests: Synthesizing High-Quality Test Cases for LLM Coding","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T12:39:55.616900Z"},"links":{"cited_paper":"/paper/2107.03374","citing_paper":"/paper/2505.24098"},"observation_digest":"sha256:1b280304e33b254923ebdeee276ffcc33582242320d0aefa33011c81faf703d6","observation_id":"061501b8-bf53-43ab-a118-6973da65e000","resolution":{"observed_at":"2026-08-07T12:39:55.616900Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:40:00.345478Z","title":"{n} { m}","venue":null,"work_id":"e8ecebaa-fcc6-41de-8203-5ea2943909f0","year":2024},"citing_paper":{"arxiv_id":"2505.24098","last_updated":"2025-05-30T01:00:34Z","snapshot_observed_at":"2026-08-09T17:58:14.173767Z","submitted_at":"2025-05-30T01:00:34Z","title":"HardTests: Synthesizing High-Quality Test Cases for LLM Coding","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T12:39:59.017463Z"},"links":{"citing_paper":"/paper/2505.24098"},"observation_digest":"sha256:c02e0bdc098a298d66300475a3753a9365d299d05720d3992e5cd4bca4654507","observation_id":"1e236a05-f216-4964-b56f-286e65daac9d","resolution":{"observed_at":"2026-08-07T12:40:00.424892Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2105.09938","last_updated":"2021-11-08T21:16:44Z","snapshot_observed_at":"2026-08-04T23:13:25.514661Z","submitted_at":"2021-05-20T17:58:42Z","title":"Measuring Coding Challenge Competence With APPS","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2105.09938","snapshot_observed_at":"2026-08-07T12:39:55.896221Z","title":"Measuring coding challenge competence with apps","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.24098","last_updated":"2025-05-30T01:00:34Z","snapshot_observed_at":"2026-08-09T17:58:14.173767Z","submitted_at":"2025-05-30T01:00:34Z","title":"HardTests: Synthesizing High-Quality Test Cases for LLM Coding","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T12:39:55.896221Z"},"links":{"cited_paper":"/paper/2105.09938","citing_paper":"/paper/2505.24098"},"observation_digest":"sha256:651b6a1b26008da0480523419df31da040fc603bbfdef3c6710c488be76db21a","observation_id":"2df2e97a-34d1-494c-8141-6e19422bf7fb","resolution":{"observed_at":"2026-08-07T12:39:55.896221Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.01296","last_updated":"2025-04-02T01:59:26Z","snapshot_observed_at":"2026-07-30T08:40:23.849282Z","submitted_at":"2025-04-02T01:59:26Z","title":"ThinkPrune: Pruning Long Chain-of-Thought of LLMs via Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.01296","snapshot_observed_at":"2026-08-07T12:39:56.068560Z","title":"Thinkprune: Pruning long chain-of-thought of llms via reinforcement learning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.24098","last_updated":"2025-05-30T01:00:34Z","snapshot_observed_at":"2026-08-09T17:58:14.173767Z","submitted_at":"2025-05-30T01:00:34Z","title":"HardTests: Synthesizing High-Quality Test Cases for LLM Coding","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T12:39:56.068560Z"},"links":{"cited_paper":"/paper/2504.01296","citing_paper":"/paper/2505.24098"},"observation_digest":"sha256:777a7105c2b1df03a31b1c4cb7348aa03e77aa92826b108b71dcf0b323292509","observation_id":"e776c6e1-13d8-4fcc-b270-a166d4077ee4","resolution":{"observed_at":"2026-08-07T12:39:56.068560Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.00752","last_updated":"2025-03-18T19:50:04Z","snapshot_observed_at":"2026-08-04T14:50:34.271833Z","submitted_at":"2024-10-01T14:47:05Z","title":"TestGenEval: A Real World Unit Test Generation and Test Completion Benchmark","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.00752","snapshot_observed_at":"2026-08-07T12:39:56.138659Z","title":"Testgeneval: A real world unit test generation and test completion benchmark, 2025a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.24098","last_updated":"2025-05-30T01:00:34Z","snapshot_observed_at":"2026-08-09T17:58:14.173767Z","submitted_at":"2025-05-30T01:00:34Z","title":"HardTests: Synthesizing High-Quality Test Cases for LLM Coding","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T12:39:56.138659Z"},"links":{"cited_paper":"/paper/2410.00752","citing_paper":"/paper/2505.24098"},"observation_digest":"sha256:c129eb8910c5d4cd2a00cb52c945c01dd1b3486ba0607576af20f3a4e738a279","observation_id":"24efad3f-0eec-4e62-8e7b-b58fb412704c","resolution":{"observed_at":"2026-08-07T12:39:56.138659Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12599","last_updated":"2025-06-03T02:14:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T02:48:14Z","title":"Kimi k1.5: Scaling Reinforcement Learning with LLMs","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12599","snapshot_observed_at":"2026-08-07T12:39:56.209649Z","title":"Hung Le, Yue Wang, Akhilesh Deepak Gotmare, Silvio Savarese, and Steven Chu Hong Hoi","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.24098","last_updated":"2025-05-30T01:00:34Z","snapshot_observed_at":"2026-08-09T17:58:14.173767Z","submitted_at":"2025-05-30T01:00:34Z","title":"HardTests: Synthesizing High-Quality Test Cases for LLM Coding","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T12:39:56.209649Z"},"links":{"cited_paper":"/paper/2501.12599","citing_paper":"/paper/2505.24098"},"observation_digest":"sha256:3a99a70e68f12a4f7bbf3c2a35e04fe317cb20eb3fcc339387f11a6845457d08","observation_id":"82c7557f-7a31-4555-a1dc-c81aa76c3ac5","resolution":{"observed_at":"2026-08-07T12:39:56.209649Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.07814","last_updated":"2022-02-08T23:16:31Z","snapshot_observed_at":"2026-08-09T23:18:44.909862Z","submitted_at":"2022-02-08T23:16:31Z","title":"Competition-Level Code Generation with AlphaCode","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.07814","snapshot_observed_at":"2026-08-07T12:39:56.557357Z","title":"Competition-level code generation with alphacode","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.24098","last_updated":"2025-05-30T01:00:34Z","snapshot_observed_at":"2026-08-09T17:58:14.173767Z","submitted_at":"2025-05-30T01:00:34Z","title":"HardTests: Synthesizing High-Quality Test Cases for LLM Coding","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T12:39:56.557357Z"},"links":{"cited_paper":"/paper/2203.07814","citing_paper":"/paper/2505.24098"},"observation_digest":"sha256:62ca17df863ffc796c9cde94689e58db3c61b59e4a4f3fb9c81613e41501d39e","observation_id":"20512dfd-441a-43d1-8ede-44926968ecd0","resolution":{"observed_at":"2026-08-07T12:39:56.557357Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.05010","last_updated":"2025-02-25T03:17:46Z","snapshot_observed_at":"2026-07-06T19:46:54.707852Z","submitted_at":"2024-10-22T01:58:29Z","title":"Scattered Forest Search: Smarter Code Space Exploration with LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.05010","snapshot_observed_at":"2026-08-07T12:39:56.669431Z","title":"11 Jiawei Liu and Lingming Zhang","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.24098","last_updated":"2025-05-30T01:00:34Z","snapshot_observed_at":"2026-08-09T17:58:14.173767Z","submitted_at":"2025-05-30T01:00:34Z","title":"HardTests: Synthesizing High-Quality Test Cases for LLM Coding","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T12:39:56.669431Z"},"links":{"cited_paper":"/paper/2411.05010","citing_paper":"/paper/2505.24098"},"observation_digest":"sha256:bdfbbb1f7c15d9d0b87e1203f296c5efc433eebdca0bc797c54feba63f4f51eb","observation_id":"6bf60f56-81a0-44af-8315-8fc8bfe65d73","resolution":{"observed_at":"2026-08-07T12:39:56.669431Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.01210","last_updated":"2023-10-30T19:37:09Z","snapshot_observed_at":"2026-08-09T13:00:51.978208Z","submitted_at":"2023-05-02T05:46:48Z","title":"Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.01210","snapshot_observed_at":"2026-08-07T12:39:56.781297Z","title":"Yifei Liu, Li Lyna Zhang, Yi Zhu, Bingcheng Dong, Xudong Zhou, Ning Shang, Fan Yang, and Mao Yang","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.24098","last_updated":"2025-05-30T01:00:34Z","snapshot_observed_at":"2026-08-09T17:58:14.173767Z","submitted_at":"2025-05-30T01:00:34Z","title":"HardTests: Synthesizing High-Quality Test Cases for LLM Coding","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T12:39:56.781297Z"},"links":{"cited_paper":"/paper/2305.01210","citing_paper":"/paper/2505.24098"},"observation_digest":"sha256:f7a8b6ffd0a41287d9d67202a80997d755f87b9e23382ed0878792b6cf2a2385","observation_id":"87d06d85-d232-48cf-8b08-7e612b513762","resolution":{"observed_at":"2026-08-07T12:39:56.781297Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.21297","last_updated":"2025-05-27T15:00:57Z","snapshot_observed_at":"2026-08-07T13:28:17.822753Z","submitted_at":"2025-05-27T15:00:57Z","title":"rStar-Coder: Scaling Competitive Code Reasoning with a Large-Scale Verified Dataset","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.21297","snapshot_observed_at":"2026-08-07T12:39:56.905741Z","title":"Stephan Lukasczyk and Gordon Fraser","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.24098","last_updated":"2025-05-30T01:00:34Z","snapshot_observed_at":"2026-08-09T17:58:14.173767Z","submitted_at":"2025-05-30T01:00:34Z","title":"HardTests: Synthesizing High-Quality Test Cases for LLM Coding","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T12:39:56.905741Z"},"links":{"cited_paper":"/paper/2505.21297","citing_paper":"/paper/2505.24098"},"observation_digest":"sha256:7ef74c26fc5f1eaf7df883bfdb5622ad9bce58c11f78e5db2327dcd4bf9f133d","observation_id":"4fe2febf-5736-49ce-ae1f-f9eefc4f3563","resolution":{"observed_at":"2026-08-07T12:39:56.905741Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:39:57.037173Z","title":"URL http://dx.doi.org/10.1145/3510454.3516829","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.24098","last_updated":"2025-05-30T01:00:34Z","snapshot_observed_at":"2026-08-09T17:58:14.173767Z","submitted_at":"2025-05-30T01:00:34Z","title":"HardTests: Synthesizing High-Quality Test Cases for LLM Coding","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T12:39:57.037173Z"},"links":{"citing_paper":"/paper/2505.24098"},"observation_digest":"sha256:51d8204d565faae96b362b8754b35711aaf9712a521675c785e7a2f7c5e0948a","observation_id":"202c5d0d-e4de-49bf-9e6e-a487bf6ee355","resolution":{"observed_at":"2026-08-07T12:39:57.037173Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16720","last_updated":"2026-04-30T02:46:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-21T18:04:31Z","title":"OpenAI o1 System Card","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.16720","snapshot_observed_at":"2026-08-07T12:39:57.197862Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.24098","last_updated":"2025-05-30T01:00:34Z","snapshot_observed_at":"2026-08-09T17:58:14.173767Z","submitted_at":"2025-05-30T01:00:34Z","title":"HardTests: Synthesizing High-Quality Test Cases for LLM Coding","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T12:39:57.197862Z"},"links":{"cited_paper":"/paper/2412.16720","citing_paper":"/paper/2505.24098"},"observation_digest":"sha256:54f3e93e5c90ab0bcb547aaa406f6a17e28043585614aebea3fb5f879d780cb7","observation_id":"d89f2e36-8c6d-44cb-a848-bf6604ace09f","resolution":{"observed_at":"2026-08-07T12:39:57.197862Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.06807","last_updated":"2025-02-18T22:21:40Z","snapshot_observed_at":"2026-08-09T14:06:29.234036Z","submitted_at":"2025-02-03T23:00:15Z","title":"Competitive Programming with Large Reasoning Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.06807","snapshot_observed_at":"2026-08-07T12:39:57.365862Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.24098","last_updated":"2025-05-30T01:00:34Z","snapshot_observed_at":"2026-08-09T17:58:14.173767Z","submitted_at":"2025-05-30T01:00:34Z","title":"HardTests: Synthesizing High-Quality Test Cases for LLM Coding","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T12:39:57.365862Z"},"links":{"cited_paper":"/paper/2502.06807","citing_paper":"/paper/2505.24098"},"observation_digest":"sha256:10eaa4ad5785ed85454d5a1950b81855c48248ad8f64a1f538db4b869d35741b","observation_id":"82330be4-dce1-4de6-8fb7-88075f7db129","resolution":{"observed_at":"2026-08-07T12:39:57.365862Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.02827","last_updated":"2025-02-05T02:08:51Z","snapshot_observed_at":"2026-08-09T21:02:29.655021Z","submitted_at":"2025-02-05T02:08:51Z","title":"COFFE: A Code Efficiency Benchmark for Code Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.02827","snapshot_observed_at":"2026-08-07T12:39:57.465250Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.24098","last_updated":"2025-05-30T01:00:34Z","snapshot_observed_at":"2026-08-09T17:58:14.173767Z","submitted_at":"2025-05-30T01:00:34Z","title":"HardTests: Synthesizing High-Quality Test Cases for LLM Coding","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T12:39:57.465250Z"},"links":{"cited_paper":"/paper/2502.02827","citing_paper":"/paper/2505.24098"},"observation_digest":"sha256:956f45e7ad687066f0c08ab41eb3e015617602410e14486f1195b0366759a0ab","observation_id":"aa34b9b4-ffad-4aa3-83ca-aa3829bb7f6f","resolution":{"observed_at":"2026-08-07T12:39:57.465250Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-07T12:39:57.560048Z","title":"Guangming Sheng, Chi Zhang, Zilingfeng Ye, Xibin Wu, Wang Zhang, Ru Zhang, Yanghua Peng, Haibin Lin, and Chuan Wu","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.24098","last_updated":"2025-05-30T01:00:34Z","snapshot_observed_at":"2026-08-09T17:58:14.173767Z","submitted_at":"2025-05-30T01:00:34Z","title":"HardTests: Synthesizing High-Quality Test Cases for LLM Coding","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T12:39:57.560048Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2505.24098"},"observation_digest":"sha256:8751da4f017d560c78e0267a6a96c294314f2a0b2e8b996095f0c81ed663de9e","observation_id":"ca57237a-acf1-443b-a1e0-ad4fabb214be","resolution":{"observed_at":"2026-08-07T12:39:57.560048Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.06585","last_updated":"2024-04-18T03:12:09Z","snapshot_observed_at":"2026-08-08T12:03:18.710098Z","submitted_at":"2023-12-11T18:17:43Z","title":"Beyond Human Data: Scaling Self-Training for Problem-Solving with Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.06585","snapshot_observed_at":"2026-08-07T12:39:57.636759Z","title":"Beyond human data: Scaling self-training for problem-solving with language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.24098","last_updated":"2025-05-30T01:00:34Z","snapshot_observed_at":"2026-08-09T17:58:14.173767Z","submitted_at":"2025-05-30T01:00:34Z","title":"HardTests: Synthesizing High-Quality Test Cases for LLM Coding","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T12:39:57.636759Z"},"links":{"cited_paper":"/paper/2312.06585","citing_paper":"/paper/2505.24098"},"observation_digest":"sha256:9d12d857a682dc9e55c9c0c19a2984a47b4bb2614046135e2fe3d0397441bbd7","observation_id":"0d04703e-ce4e-42be-a82d-05ff6f566335","resolution":{"observed_at":"2026-08-07T12:39:57.636759Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04531","last_updated":"2025-02-01T08:28:28Z","snapshot_observed_at":"2026-07-06T18:26:50.515452Z","submitted_at":"2024-06-06T22:07:50Z","title":"TESTEVAL: Benchmarking Large Language Models for Test Case Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.04531","snapshot_observed_at":"2026-08-07T12:39:57.721681Z","title":"Testeval: Benchmarking large language models for test case generation, 2025a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.24098","last_updated":"2025-05-30T01:00:34Z","snapshot_observed_at":"2026-08-09T17:58:14.173767Z","submitted_at":"2025-05-30T01:00:34Z","title":"HardTests: Synthesizing High-Quality Test Cases for LLM Coding","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T12:39:57.721681Z"},"links":{"cited_paper":"/paper/2406.04531","citing_paper":"/paper/2505.24098"},"observation_digest":"sha256:e3791ff0b3ab62fb61156877ee53f4317662db2ae474d123243b4320a17b9cad","observation_id":"9d92569e-dd0a-41c5-9707-ddcccb60ff5d","resolution":{"observed_at":"2026-08-07T12:39:57.721681Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.02951","last_updated":"2025-07-12T02:08:21Z","snapshot_observed_at":"2026-08-07T17:29:28.382943Z","submitted_at":"2025-03-04T19:17:36Z","title":"KodCode: A Diverse, Challenging, and Verifiable Synthetic Dataset for Coding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.02951","snapshot_observed_at":"2026-08-07T12:39:57.824234Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.24098","last_updated":"2025-05-30T01:00:34Z","snapshot_observed_at":"2026-08-09T17:58:14.173767Z","submitted_at":"2025-05-30T01:00:34Z","title":"HardTests: Synthesizing High-Quality Test Cases for LLM Coding","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T12:39:57.824234Z"},"links":{"cited_paper":"/paper/2503.02951","citing_paper":"/paper/2505.24098"},"observation_digest":"sha256:0bebd32222746bea28d45e3c356a4eabb48c83a00dfb274de3cfd62df8582dd3","observation_id":"c61da6a1-b863-4077-b298-007329eaa1e2","resolution":{"observed_at":"2026-08-07T12:39:57.824234Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.03387","last_updated":"2025-07-29T16:23:02Z","snapshot_observed_at":"2026-08-08T04:13:22.884923Z","submitted_at":"2025-02-05T17:23:45Z","title":"LIMO: Less is More for Reasoning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.03387","snapshot_observed_at":"2026-08-07T12:39:57.934398Z","title":"Limo: Less is more for reasoning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.24098","last_updated":"2025-05-30T01:00:34Z","snapshot_observed_at":"2026-08-09T17:58:14.173767Z","submitted_at":"2025-05-30T01:00:34Z","title":"HardTests: Synthesizing High-Quality Test Cases for LLM Coding","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T12:39:57.934398Z"},"links":{"cited_paper":"/paper/2502.03387","citing_paper":"/paper/2505.24098"},"observation_digest":"sha256:a13fa010e4ff933ad7d499b3f7534c1cf32a00a172cf5e81841ad4ecbd8e549b","observation_id":"8b65fe22-9ec2-4d7a-b4b4-46c5125f8fd9","resolution":{"observed_at":"2026-08-07T12:39:57.934398Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.04207","last_updated":"2024-05-19T08:51:14Z","snapshot_observed_at":"2026-08-08T00:08:43.176849Z","submitted_at":"2023-05-07T07:17:08Z","title":"No More Manual Tests? Evaluating and Improving ChatGPT for Unit Test Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.04207","snapshot_observed_at":"2026-08-07T12:39:58.040594Z","title":"Eric Zelikman, Yuhuai Wu, Jesse Mu, and Noah Goodman","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.24098","last_updated":"2025-05-30T01:00:34Z","snapshot_observed_at":"2026-08-09T17:58:14.173767Z","submitted_at":"2025-05-30T01:00:34Z","title":"HardTests: Synthesizing High-Quality Test Cases for LLM Coding","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T12:39:58.040594Z"},"links":{"cited_paper":"/paper/2305.04207","citing_paper":"/paper/2505.24098"},"observation_digest":"sha256:15683028dccdb0d09be34bed6f85e8f605f5ea7e0307cad5c7e70217690cc560","observation_id":"938c11e9-cd80-453e-88aa-75b304857657","resolution":{"observed_at":"2026-08-07T12:39:58.040594Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.18892","last_updated":"2025-08-06T08:42:32Z","snapshot_observed_at":"2026-07-06T20:57:57.039376Z","submitted_at":"2025-03-24T17:06:10Z","title":"SimpleRL-Zoo: Investigating and Taming Zero Reinforcement Learning for Open Base Models in the Wild","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.18892","snapshot_observed_at":"2026-08-07T12:39:58.116873Z","title":"Acecoder: Acing coder rl via automated test-case synthesis, 2025a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.24098","last_updated":"2025-05-30T01:00:34Z","snapshot_observed_at":"2026-08-09T17:58:14.173767Z","submitted_at":"2025-05-30T01:00:34Z","title":"HardTests: Synthesizing High-Quality Test Cases for LLM Coding","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T12:39:58.116873Z"},"links":{"cited_paper":"/paper/2503.18892","citing_paper":"/paper/2505.24098"},"observation_digest":"sha256:f29d8c070a43ee61c90c43d3a4cba5c624c82443d8989710dcede1e31aadc865","observation_id":"ae0285f0-db1e-4107-888c-a8124f293355","resolution":{"observed_at":"2026-08-07T12:39:58.116873Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.14591","last_updated":"2023-12-08T00:12:58Z","snapshot_observed_at":"2026-08-06T06:52:21.527894Z","submitted_at":"2023-05-24T00:10:15Z","title":"ALGO: Synthesizing Algorithmic Programs with LLM-Generated Oracle Verifiers","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.14591","snapshot_observed_at":"2026-08-07T12:39:58.211974Z","title":"Quanjun Zhang, Ye Shang, Chunrong Fang, Siqi Gu, Jianyi Zhou, and Zhenyu Chen","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.24098","last_updated":"2025-05-30T01:00:34Z","snapshot_observed_at":"2026-08-09T17:58:14.173767Z","submitted_at":"2025-05-30T01:00:34Z","title":"HardTests: Synthesizing High-Quality Test Cases for LLM Coding","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T12:39:58.211974Z"},"links":{"cited_paper":"/paper/2305.14591","citing_paper":"/paper/2505.24098"},"observation_digest":"sha256:c665d73f39ee9b9f3ecc1ceca30c1c0e29ae0888a7b4227572a679b36a0968ab","observation_id":"7fe0e6ca-7484-47d1-a1e4-74c89c72c79e","resolution":{"observed_at":"2026-08-07T12:39:58.211974Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.17561","last_updated":"2024-09-26T06:18:06Z","snapshot_observed_at":"2026-07-06T19:22:32.667859Z","submitted_at":"2024-09-26T06:18:06Z","title":"TestBench: Evaluating Class-Level Test Case Generation Capability of Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.17561","snapshot_observed_at":"2026-08-07T12:39:58.370843Z","title":"Yaowei Zheng, Richong Zhang, Junhao Zhang, Yanhan Ye, Zheyan Luo, Zhangchi Feng, and Yongqiang Ma","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.24098","last_updated":"2025-05-30T01:00:34Z","snapshot_observed_at":"2026-08-09T17:58:14.173767Z","submitted_at":"2025-05-30T01:00:34Z","title":"HardTests: Synthesizing High-Quality Test Cases for LLM Coding","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T12:39:58.370843Z"},"links":{"cited_paper":"/paper/2409.17561","citing_paper":"/paper/2505.24098"},"observation_digest":"sha256:5dc5459feda5b2ff6fbb3c3a843ad8a70765fd45ba8afa995c453513606ae05c","observation_id":"05460c55-7a88-42d1-a9f5-469868613ccd","resolution":{"observed_at":"2026-08-07T12:39:58.370843Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.13372","last_updated":"2024-06-27T22:44:48Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-03-20T08:08:54Z","title":"LlamaFactory: Unified Efficient Fine-Tuning of 100+ Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.13372","snapshot_observed_at":"2026-08-07T12:39:58.472965Z","title":"URL http://arxiv.org/abs/2403.13372","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.24098","last_updated":"2025-05-30T01:00:34Z","snapshot_observed_at":"2026-08-09T17:58:14.173767Z","submitted_at":"2025-05-30T01:00:34Z","title":"HardTests: Synthesizing High-Quality Test Cases for LLM Coding","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T12:39:58.472965Z"},"links":{"cited_paper":"/paper/2403.13372","citing_paper":"/paper/2505.24098"},"observation_digest":"sha256:027ff3baa8502aa39913df91096cad19d78dca0512bc585df762d5480eacfbd3","observation_id":"e74403fe-084f-422b-9b8d-5d4808eebf4f","resolution":{"observed_at":"2026-08-07T12:39:58.472965Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:40:01.047186Z","title":null,"venue":null,"work_id":"30a50854-0ed9-4c6f-b318-886ea2fe62d1","year":2025},"citing_paper":{"arxiv_id":"2505.24098","last_updated":"2025-05-30T01:00:34Z","snapshot_observed_at":"2026-08-09T17:58:14.173767Z","submitted_at":"2025-05-30T01:00:34Z","title":"HardTests: Synthesizing High-Quality Test Cases for LLM Coding","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T12:39:58.578150Z"},"links":{"citing_paper":"/paper/2505.24098"},"observation_digest":"sha256:51f6cfd9d27458c10b91701c499be12ab219f20190ff7fb2f188ef1b99bfc983","observation_id":"5a0d58dc-98f6-4d04-abb3-7da3faa8eed2","resolution":{"observed_at":"2026-08-07T12:40:01.099920Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:40:00.891434Z","title":"core logic","venue":null,"work_id":"9fc458b8-c03e-4646-bee8-96cf6801701e","year":2023},"citing_paper":{"arxiv_id":"2505.24098","last_updated":"2025-05-30T01:00:34Z","snapshot_observed_at":"2026-08-09T17:58:14.173767Z","submitted_at":"2025-05-30T01:00:34Z","title":"HardTests: Synthesizing High-Quality Test Cases for LLM Coding","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T12:39:58.714694Z"},"links":{"citing_paper":"/paper/2505.24098"},"observation_digest":"sha256:ed77a3dbe6afaf78b7bcc028890f6de5d4be8bd94d7c8d3f2d468da8e002c182","observation_id":"dcfff285-cc90-4ffd-a491-3123e6f4879e","resolution":{"observed_at":"2026-08-07T12:40:00.965186Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:40:00.539229Z","title":"3\\n1 10\\n2 8\\n3 10","venue":null,"work_id":"f9745b90-9057-4f1d-a982-1383e28e9875","year":2000},"citing_paper":{"arxiv_id":"2505.24098","last_updated":"2025-05-30T01:00:34Z","snapshot_observed_at":"2026-08-09T17:58:14.173767Z","submitted_at":"2025-05-30T01:00:34Z","title":"HardTests: Synthesizing High-Quality Test Cases for LLM Coding","version":1},"reference_index":1000,"source":"pdf_text","source_observed_at":"2026-08-07T12:39:58.905686Z"},"links":{"citing_paper":"/paper/2505.24098"},"observation_digest":"sha256:afe3c666691f170e749ec8e10c6602f583ac3bd3c44e6bac7a73cfab2f1863ea","observation_id":"d69afd2e-7914-4815-a77d-59fb5b820682","resolution":{"observed_at":"2026-08-07T12:40:00.611877Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:39:55.691285Z","title":"ISBN 9781450304436","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.24098","last_updated":"2025-05-30T01:00:34Z","snapshot_observed_at":"2026-08-09T17:58:14.173767Z","submitted_at":"2025-05-30T01:00:34Z","title":"HardTests: Synthesizing High-Quality Test Cases for LLM Coding","version":1},"reference_index":2011,"source":"pdf_text","source_observed_at":"2026-08-07T12:39:55.691285Z"},"links":{"citing_paper":"/paper/2505.24098"},"observation_digest":"sha256:b9e925f08d986f299d4ccf73bd44b8492ff2fdf69b597185996d2205eb741d51","observation_id":"c47beb24-a9e0-4f8b-8614-f0da8e6c0637","resolution":{"observed_at":"2026-08-07T12:39:55.691285Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2108.07732","last_updated":"2021-08-16T03:57:30Z","snapshot_observed_at":"2026-08-02T19:23:53.535075Z","submitted_at":"2021-08-16T03:57:30Z","title":"Program Synthesis with Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2108.07732","snapshot_observed_at":"2026-08-07T12:39:55.538922Z","title":"Bei Chen, Fengji Zhang, Anh Nguyen, Daoguang Zan, Zeqi Lin, Jian-Guang Lou, and Weizhu Chen","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.24098","last_updated":"2025-05-30T01:00:34Z","snapshot_observed_at":"2026-08-09T17:58:14.173767Z","submitted_at":"2025-05-30T01:00:34Z","title":"HardTests: Synthesizing High-Quality Test Cases for LLM Coding","version":1},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-07T12:39:55.538922Z"},"links":{"cited_paper":"/paper/2108.07732","citing_paper":"/paper/2505.24098"},"observation_digest":"sha256:72889e089abd27360c0e7e35a54692a89e0ccaf4c8efbdf545201c81a7514dfb","observation_id":"5115e784-7837-4ed2-986a-be32a29beb91","resolution":{"observed_at":"2026-08-07T12:39:55.538922Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.14852","last_updated":"2023-12-27T10:09:18Z","snapshot_observed_at":"2026-07-06T17:07:14.412645Z","submitted_at":"2023-12-22T17:25:42Z","title":"TACO: Topics in Algorithmic COde generation dataset","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.14852","snapshot_observed_at":"2026-08-07T12:39:56.321057Z","title":"Taco: Topics in algorithmic code generation dataset","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.24098","last_updated":"2025-05-30T01:00:34Z","snapshot_observed_at":"2026-08-09T17:58:14.173767Z","submitted_at":"2025-05-30T01:00:34Z","title":"HardTests: Synthesizing High-Quality Test Cases for LLM Coding","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-07T12:39:56.321057Z"},"links":{"cited_paper":"/paper/2312.14852","citing_paper":"/paper/2505.24098"},"observation_digest":"sha256:4f1f7cedfc38e7231cf21a77fe3b7ac1f754b223d37c20a5a8e941fdd2231834","observation_id":"5d72edb9-f7f9-44e4-8f82-d98ba46e6223","resolution":{"observed_at":"2026-08-07T12:39:56.321057Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.11886","last_updated":"2025-02-17T15:13:29Z","snapshot_observed_at":"2026-08-09T18:20:45.496028Z","submitted_at":"2025-02-17T15:13:29Z","title":"LIMR: Less is More for RL Scaling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.11886","snapshot_observed_at":"2026-08-07T12:39:56.430228Z","title":"Limr: Less is more for rl scaling","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.24098","last_updated":"2025-05-30T01:00:34Z","snapshot_observed_at":"2026-08-09T17:58:14.173767Z","submitted_at":"2025-05-30T01:00:34Z","title":"HardTests: Synthesizing High-Quality Test Cases for LLM Coding","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-07T12:39:56.430228Z"},"links":{"cited_paper":"/paper/2502.11886","citing_paper":"/paper/2505.24098"},"observation_digest":"sha256:955776687a8e78ca2ccfe9543ab363c327f2bf984f16ebaa910fd6f78afb0617","observation_id":"ba80164b-d1a3-4ad6-b274-f52d49fe5572","resolution":{"observed_at":"2026-08-07T12:39:56.430228Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.02883","last_updated":"2024-12-03T22:38:05Z","snapshot_observed_at":"2026-08-09T14:07:19.465632Z","submitted_at":"2024-12-03T22:38:05Z","title":"TDD-Bench Verified: Can LLMs Generate Tests for Issues Before They Get Resolved?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.02883","snapshot_observed_at":"2026-08-07T12:39:55.474805Z","title":"org/abs/2412.02883","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.24098","last_updated":"2025-05-30T01:00:34Z","snapshot_observed_at":"2026-08-09T17:58:14.173767Z","submitted_at":"2025-05-30T01:00:34Z","title":"HardTests: Synthesizing High-Quality Test Cases for LLM Coding","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-07T12:39:55.474805Z"},"links":{"cited_paper":"/paper/2412.02883","citing_paper":"/paper/2505.24098"},"observation_digest":"sha256:5002bfd8416d7fabe5bfbff2cec96f30ad62b6404123b126708380f87a170a6e","observation_id":"f145b96d-c545-4261-bb99-07a16a9a238b","resolution":{"observed_at":"2026-08-07T12:39:55.474805Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.01943","last_updated":"2025-08-07T23:04:55Z","snapshot_observed_at":"2026-08-08T04:08:24.938705Z","submitted_at":"2025-04-02T17:50:31Z","title":"OpenCodeReasoning: Advancing Data Distillation for Competitive Coding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.01943","snapshot_observed_at":"2026-08-07T12:39:55.391872Z","title":"Toufique Ahmed, Martin Hirzel, Rangeet Pan, Avraham Shinnar, and Saurabh Sinha","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.24098","last_updated":"2025-05-30T01:00:34Z","snapshot_observed_at":"2026-08-09T17:58:14.173767Z","submitted_at":"2025-05-30T01:00:34Z","title":"HardTests: Synthesizing High-Quality Test Cases for LLM Coding","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-07T12:39:55.391872Z"},"links":{"cited_paper":"/paper/2504.01943","citing_paper":"/paper/2505.24098"},"observation_digest":"sha256:91385e47c9be46d8a45a0279e783329d2d389b612ef1ff1d70f39f0c0f0dc291","observation_id":"51511022-9523-4e30-8b97-5c23997f1d84","resolution":{"observed_at":"2026-08-07T12:39:55.391872Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2505.24098","last_updated":"2025-05-30T01:00:34Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-09T17:58:14.173767Z","submitted_at":"2025-05-30T01:00:34Z","title":"HardTests: Synthesizing High-Quality Test Cases for LLM Coding"},"reference_resolution":{"displayed":35,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":30,"verified_exact":0,"verified_fuzzy":5},"total_outbound_references":35},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 35 of 35 outbound references and 8 inbound Pith citation observations for arXiv:2505.24098."}