{"as_of":"2026-08-17T16:54:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:72a3a8e4b27e26ae3d1d16e42dd8dd13b825bc5113faeddb88292f42fa4d9e11","coverage":[{"denominator":13,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":13,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-01T03:57:40.804853Z","state":"measured"},{"denominator":13,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":13,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-17T06:30:58.91139+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.23002/citation-record","integrity":"/paper/2607.23002/integrity","json":"/paper/2607.23002/citation-record.json","paper":"/paper/2607.23002"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2408.11324","last_updated":"2024-08-21T04:14:26Z","snapshot_observed_at":"2026-08-16T13:25:01.205114Z","submitted_at":"2024-08-21T04:14:26Z","title":"HITS: High-coverage LLM-based Unit Test Generation via Method Slicing","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.11324","snapshot_observed_at":"2026-08-01T03:57:40.762460Z","title":"Automated Unit Test Improvement using Large Language Models at Meta","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.23002","last_updated":"2026-07-25T02:38:07Z","snapshot_observed_at":"2026-08-09T04:08:38.159012Z","submitted_at":"2026-07-25T02:38:07Z","title":"Adversarial Test-Hardening for AI-Written Code: An Instrument Autopsy and a Pre-Registered Causal Estimate of the Critic Loop","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-01T03:57:40.762460Z"},"links":{"cited_paper":"/paper/2408.11324","citing_paper":"/paper/2607.23002"},"observation_digest":"sha256:ede643fba1cf77eca181717cfeaa9b600da9178e637f74cc15150ead57be8149","observation_id":"c72079c3-cb88-4ff8-bbd8-11d56d9f99b7","resolution":{"observed_at":"2026-08-01T03:57:40.762460Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.13076","last_updated":"2024-04-15T16:49:59Z","snapshot_observed_at":"2026-08-15T16:38:26.345282Z","submitted_at":"2024-04-15T16:49:59Z","title":"LLM Evaluators Recognize and Favor Their Own Generations","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.13076","snapshot_observed_at":"2026-08-01T03:57:40.766985Z","title":"Improving Factuality and Rea- soning in Language Models through Multiagent Debate","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.23002","last_updated":"2026-07-25T02:38:07Z","snapshot_observed_at":"2026-08-09T04:08:38.159012Z","submitted_at":"2026-07-25T02:38:07Z","title":"Adversarial Test-Hardening for AI-Written Code: An Instrument Autopsy and a Pre-Registered Causal Estimate of the Critic Loop","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-01T03:57:40.766985Z"},"links":{"cited_paper":"/paper/2404.13076","citing_paper":"/paper/2607.23002"},"observation_digest":"sha256:b856068362d0c466fc72ab023594de7ed28eceae26169f9f6464a24308d42e1f","observation_id":"77756427-eb8a-4b8b-b500-35275fd6bb24","resolution":{"observed_at":"2026-08-01T03:57:40.766985Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.14325","last_updated":"2023-05-23T17:55:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-05-23T17:55:11Z","title":"Improving Factuality and Reasoning in Language Models through Multiagent Debate","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.14325","snapshot_observed_at":"2026-08-01T03:57:40.771519Z","title":"Rethinking Mixture-of-Agents: Is Mixing Different Large Language Models Beneficial?","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.23002","last_updated":"2026-07-25T02:38:07Z","snapshot_observed_at":"2026-08-09T04:08:38.159012Z","submitted_at":"2026-07-25T02:38:07Z","title":"Adversarial Test-Hardening for AI-Written Code: An Instrument Autopsy and a Pre-Registered Causal Estimate of the Critic Loop","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-01T03:57:40.771519Z"},"links":{"cited_paper":"/paper/2305.14325","citing_paper":"/paper/2607.23002"},"observation_digest":"sha256:62c416d939aaed3e73a68344e52566d62b0abb22b89e79d4cd09b56d00910136","observation_id":"d1890c78-32a4-43c5-9ac1-cc910ac0fc50","resolution":{"observed_at":"2026-08-01T03:57:40.771519Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.04313","last_updated":"2025-06-12T14:43:36Z","snapshot_observed_at":"2026-08-13T07:09:13.997727Z","submitted_at":"2025-02-06T18:56:01Z","title":"Great Models Think Alike and this Undermines AI Oversight","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.04313","snapshot_observed_at":"2026-08-01T03:57:40.784183Z","title":"TestForge: Feedback-Driven, Agentic Test Suite Gen- eration","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.23002","last_updated":"2026-07-25T02:38:07Z","snapshot_observed_at":"2026-08-09T04:08:38.159012Z","submitted_at":"2026-07-25T02:38:07Z","title":"Adversarial Test-Hardening for AI-Written Code: An Instrument Autopsy and a Pre-Registered Causal Estimate of the Critic Loop","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-01T03:57:40.784183Z"},"links":{"cited_paper":"/paper/2502.04313","citing_paper":"/paper/2607.23002"},"observation_digest":"sha256:40e5083b1ebf3cc9e0462950f96984f932f2c9e236e9a223afe815e482bd18a0","observation_id":"5edd23c8-e32f-443d-abcc-7c43b8f7eec3","resolution":{"observed_at":"2026-08-01T03:57:40.784183Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14713","last_updated":"2025-03-18T20:21:44Z","snapshot_observed_at":"2026-08-16T12:48:49.878245Z","submitted_at":"2025-03-18T20:21:44Z","title":"TestForge: Feedback-Driven, Agentic Test Suite Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.14713","snapshot_observed_at":"2026-08-01T03:57:40.788358Z","title":"EvoSuite: Automatic Test Suite Generation for Object- Oriented Software","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2607.23002","last_updated":"2026-07-25T02:38:07Z","snapshot_observed_at":"2026-08-09T04:08:38.159012Z","submitted_at":"2026-07-25T02:38:07Z","title":"Adversarial Test-Hardening for AI-Written Code: An Instrument Autopsy and a Pre-Registered Causal Estimate of the Critic Loop","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-01T03:57:40.788358Z"},"links":{"cited_paper":"/paper/2503.14713","citing_paper":"/paper/2607.23002"},"observation_digest":"sha256:7ba6d342b598f30dc171975e7073eff851b64b5dbcc065e67fc69664de4af10b","observation_id":"b96d9aec-229d-49c0-8c0f-0037c26bb2c9","resolution":{"observed_at":"2026-08-01T03:57:40.788358Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.03649","last_updated":"2023-02-07T18:02:19Z","snapshot_observed_at":"2026-08-16T15:57:01.431454Z","submitted_at":"2023-02-07T18:02:19Z","title":"Registered Reports in Software Engineering","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.03649","snapshot_observed_at":"2026-08-01T03:57:40.792701Z","title":"Watts and Debts of Agentic Frameworks: An Empirical Study (Registered Report)","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.23002","last_updated":"2026-07-25T02:38:07Z","snapshot_observed_at":"2026-08-09T04:08:38.159012Z","submitted_at":"2026-07-25T02:38:07Z","title":"Adversarial Test-Hardening for AI-Written Code: An Instrument Autopsy and a Pre-Registered Causal Estimate of the Critic Loop","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-01T03:57:40.792701Z"},"links":{"cited_paper":"/paper/2302.03649","citing_paper":"/paper/2607.23002"},"observation_digest":"sha256:403839996cec6ead98f807186f595ea796f893f15d2e8d76ce87cc1b306bd482","observation_id":"ec47ea65-66f6-4941-ac0c-7d60aa9fefde","resolution":{"observed_at":"2026-08-01T03:57:40.792701Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.04748","last_updated":"2024-12-09T20:47:17Z","snapshot_observed_at":"2026-08-16T15:09:45.839371Z","submitted_at":"2023-08-09T07:36:21Z","title":"Fuzz4All: Universal Fuzzing with Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.04748","snapshot_observed_at":"2026-08-01T03:57:40.804853Z","title":"An Empirical Analysis of Flaky Tests","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2607.23002","last_updated":"2026-07-25T02:38:07Z","snapshot_observed_at":"2026-08-09T04:08:38.159012Z","submitted_at":"2026-07-25T02:38:07Z","title":"Adversarial Test-Hardening for AI-Written Code: An Instrument Autopsy and a Pre-Registered Causal Estimate of the Critic Loop","version":1},"reference_index":126,"source":"pdf_text","source_observed_at":"2026-08-01T03:57:40.804853Z"},"links":{"cited_paper":"/paper/2308.04748","citing_paper":"/paper/2607.23002"},"observation_digest":"sha256:a7e85424e775ecd94393ec948f2b8bc6993c7320724ebf56b1b3745ad6938463","observation_id":"22056d44-b81a-4ae6-bab1-f2b8f129ee90","resolution":{"observed_at":"2026-08-01T03:57:40.804853Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T03:57:40.796638Z","title":"Mutation Testing Advances: An Analysis and Survey","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2607.23002","last_updated":"2026-07-25T02:38:07Z","snapshot_observed_at":"2026-08-09T04:08:38.159012Z","submitted_at":"2026-07-25T02:38:07Z","title":"Adversarial Test-Hardening for AI-Written Code: An Instrument Autopsy and a Pre-Registered Causal Estimate of the Critic Loop","version":1},"reference_index":2015,"source":"pdf_text","source_observed_at":"2026-08-01T03:57:40.796638Z"},"links":{"citing_paper":"/paper/2607.23002"},"observation_digest":"sha256:6f494909d03dee47cb7de7f41bc11ade0dc02586d0e29580ee7810dba7ffd026","observation_id":"0b038097-1569-4f96-8f5a-a1e3dc6c6fdf","resolution":{"observed_at":"2026-08-01T03:57:40.796638Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.05685","last_updated":"2023-12-24T02:01:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-09T05:55:52Z","title":"Judging LLM-as-a-Judge with MT-Bench and Chatbot Arena","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.05685","snapshot_observed_at":"2026-08-01T03:57:40.800920Z","title":"Judging LLM-as-a-Judge with MT-Bench and Chatbot Arena","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.23002","last_updated":"2026-07-25T02:38:07Z","snapshot_observed_at":"2026-08-09T04:08:38.159012Z","submitted_at":"2026-07-25T02:38:07Z","title":"Adversarial Test-Hardening for AI-Written Code: An Instrument Autopsy and a Pre-Registered Causal Estimate of the Critic Loop","version":1},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-08-01T03:57:40.800920Z"},"links":{"cited_paper":"/paper/2306.05685","citing_paper":"/paper/2607.23002"},"observation_digest":"sha256:a72d8d743ffae19a7ab4c72baea8ed39581b5775c2f0c9ac3dee626462c3ea74","observation_id":"492a5aa9-ba2e-4100-ae62-220eb02b0a47","resolution":{"observed_at":"2026-08-01T03:57:40.800920Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2202.05218","last_updated":"2022-02-10T18:23:25Z","snapshot_observed_at":"2026-08-16T17:22:11.627235Z","submitted_at":"2022-02-10T18:23:25Z","title":"Pynguin: Automated Unit Test Generation for Python","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2202.05218","snapshot_observed_at":"2026-08-01T03:57:40.758128Z","title":"Pynguin: Automated Unit Test Genera- tion for Python","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.23002","last_updated":"2026-07-25T02:38:07Z","snapshot_observed_at":"2026-08-09T04:08:38.159012Z","submitted_at":"2026-07-25T02:38:07Z","title":"Adversarial Test-Hardening for AI-Written Code: An Instrument Autopsy and a Pre-Registered Causal Estimate of the Critic Loop","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-01T03:57:40.758128Z"},"links":{"cited_paper":"/paper/2202.05218","citing_paper":"/paper/2607.23002"},"observation_digest":"sha256:ae9bb3824c42df779cab96ae78a063ff91c6be6b458a2481479ff66864db8186","observation_id":"9d0c53ab-c15b-4822-816e-caade29f8723","resolution":{"observed_at":"2026-08-01T03:57:40.758128Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.06527","last_updated":"2023-12-11T11:50:51Z","snapshot_observed_at":"2026-08-17T13:14:28.509313Z","submitted_at":"2023-02-13T17:13:41Z","title":"An Empirical Evaluation of Using Large Language Models for Automated Unit Test Generation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.06527","snapshot_observed_at":"2026-08-01T03:57:40.753104Z","title":"No More Manual Tests? Evaluating and Improving ChatGPT for Unit Test Generation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.23002","last_updated":"2026-07-25T02:38:07Z","snapshot_observed_at":"2026-08-09T04:08:38.159012Z","submitted_at":"2026-07-25T02:38:07Z","title":"Adversarial Test-Hardening for AI-Written Code: An Instrument Autopsy and a Pre-Registered Causal Estimate of the Critic Loop","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-01T03:57:40.753104Z"},"links":{"cited_paper":"/paper/2302.06527","citing_paper":"/paper/2607.23002"},"observation_digest":"sha256:146367bd9225b9095a843f323578066757bd2dca9819a37836053c9c42f6919f","observation_id":"693eb81b-ba9b-48e2-aa95-db5bfc04361a","resolution":{"observed_at":"2026-08-01T03:57:40.753104Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.00674","last_updated":"2025-02-02T05:23:29Z","snapshot_observed_at":"2026-08-14T04:50:30.127326Z","submitted_at":"2025-02-02T05:23:29Z","title":"Rethinking Mixture-of-Agents: Is Mixing Different Large Language Models Beneficial?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.00674","snapshot_observed_at":"2026-08-01T03:57:40.775727Z","title":"Refute-or-Promote: An Adversarial Stage-Gated Multi- Agent Review Methodology for High-Precision LLM-Assisted Defect Discovery","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.23002","last_updated":"2026-07-25T02:38:07Z","snapshot_observed_at":"2026-08-09T04:08:38.159012Z","submitted_at":"2026-07-25T02:38:07Z","title":"Adversarial Test-Hardening for AI-Written Code: An Instrument Autopsy and a Pre-Registered Causal Estimate of the Critic Loop","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-01T03:57:40.775727Z"},"links":{"cited_paper":"/paper/2502.00674","citing_paper":"/paper/2607.23002"},"observation_digest":"sha256:b983967967413a03db5004d577dd2ec2b25070a3c481450fa1a771fb04d75e21","observation_id":"ba55738c-e6e6-46c6-b77c-84eb57d5b856","resolution":{"observed_at":"2026-08-01T03:57:40.775727Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.19049","last_updated":"2026-04-21T03:55:35Z","snapshot_observed_at":"2026-08-17T12:12:40.586412Z","submitted_at":"2026-04-21T03:55:35Z","title":"Refute-or-Promote: An Adversarial Stage-Gated Multi-Agent Review Methodology for High-Precision LLM-Assisted Defect Discovery","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.19049","snapshot_observed_at":"2026-08-01T03:57:40.779886Z","title":"Great Models Think Alike and this Undermines AI Oversight","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.23002","last_updated":"2026-07-25T02:38:07Z","snapshot_observed_at":"2026-08-09T04:08:38.159012Z","submitted_at":"2026-07-25T02:38:07Z","title":"Adversarial Test-Hardening for AI-Written Code: An Instrument Autopsy and a Pre-Registered Causal Estimate of the Critic Loop","version":1},"reference_index":2026,"source":"pdf_text","source_observed_at":"2026-08-01T03:57:40.779886Z"},"links":{"cited_paper":"/paper/2604.19049","citing_paper":"/paper/2607.23002"},"observation_digest":"sha256:913b6118b714731eac17b20d8d95b3599f0ad10dab702ce2271702e60d719185","observation_id":"e272ef24-f536-4312-a1da-6ec30669cf8b","resolution":{"observed_at":"2026-08-01T03:57:40.779886Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.23002","last_updated":"2026-07-25T02:38:07Z","latest_version":1,"primary_category":"cs.SE","snapshot_observed_at":"2026-08-09T04:08:38.159012Z","submitted_at":"2026-07-25T02:38:07Z","title":"Adversarial Test-Hardening for AI-Written Code: An Instrument Autopsy and a Pre-Registered Causal Estimate of the Critic Loop"},"reference_resolution":{"displayed":13,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":13,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":13},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"thesis":"As of 17 August 2026, this Paper Citation Record lists 13 of 13 outbound references and 0 inbound Pith citation observations for arXiv:2607.23002."}