{"as_of":"2026-08-22T19:23:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:30cbd9300462ae18626391bd6e4ad36b7038be2965b451656150f95d9bcb0a8c","coverage":[{"denominator":57,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":57,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-27T12:46:05.332740Z","state":"measured"},{"denominator":57,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":57,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-22T06:32:14.747728+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2606.10417/citation-record","integrity":"/paper/2606.10417/integrity","json":"/paper/2606.10417/citation-record.json","paper":"/paper/2606.10417"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T12:46:05.332740Z","title":"Functional program testing,","venue":null,"work_id":null,"year":1978},"citing_paper":{"arxiv_id":"2606.10417","last_updated":"2026-06-09T04:46:32Z","snapshot_observed_at":"2026-08-14T10:40:46.531578Z","submitted_at":"2026-06-09T04:46:32Z","title":"Beyond Coverage and Kill Scores: Empirically Measuring Test Suite Behavioural Gaps","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-06-27T12:46:05.332740Z"},"links":{"citing_paper":"/paper/2606.10417"},"observation_digest":"sha256:da393a9357f19f5d4cfe0f9a9aa5e893f0f733f79a2504895563c35d63c09e00","observation_id":"69856e98-c40b-4554-948f-2a6c419de7eb","resolution":{"observed_at":"2026-06-27T12:46:05.332740Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T12:46:05.332740Z","title":"Approaches to specification-based testing,","venue":null,"work_id":null,"year":1989},"citing_paper":{"arxiv_id":"2606.10417","last_updated":"2026-06-09T04:46:32Z","snapshot_observed_at":"2026-08-14T10:40:46.531578Z","submitted_at":"2026-06-09T04:46:32Z","title":"Beyond Coverage and Kill Scores: Empirically Measuring Test Suite Behavioural Gaps","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-06-27T12:46:05.332740Z"},"links":{"citing_paper":"/paper/2606.10417"},"observation_digest":"sha256:317e35f1ec94e5696ca15cf771a73d05fe8dbc959b718d97f86b2f2528e504b7","observation_id":"1b9471b1-b550-424e-a81e-b78f242f8781","resolution":{"observed_at":"2026-06-27T12:46:05.332740Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T12:46:05.332740Z","title":null,"venue":null,"work_id":null,"year":1979},"citing_paper":{"arxiv_id":"2606.10417","last_updated":"2026-06-09T04:46:32Z","snapshot_observed_at":"2026-08-14T10:40:46.531578Z","submitted_at":"2026-06-09T04:46:32Z","title":"Beyond Coverage and Kill Scores: Empirically Measuring Test Suite Behavioural Gaps","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-06-27T12:46:05.332740Z"},"links":{"citing_paper":"/paper/2606.10417"},"observation_digest":"sha256:c38e6f4d22c17a34f224b4e6331a48579246f474ffce4a52459e989c4108996a","observation_id":"e851e617-0f54-4eaf-97f2-31baef64531b","resolution":{"observed_at":"2026-06-27T12:46:05.332740Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T12:46:05.332740Z","title":"Doc2OracLL: Investigating the impact of documentation on LLM-based test oracle generation,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.10417","last_updated":"2026-06-09T04:46:32Z","snapshot_observed_at":"2026-08-14T10:40:46.531578Z","submitted_at":"2026-06-09T04:46:32Z","title":"Beyond Coverage and Kill Scores: Empirically Measuring Test Suite Behavioural Gaps","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-06-27T12:46:05.332740Z"},"links":{"citing_paper":"/paper/2606.10417"},"observation_digest":"sha256:5c72d1eb0e42a46268dc28f7326554ca154ac198391ab29e68ca00124d8c6243","observation_id":"5deadee8-6ea4-435e-9f64-2b15f03e0fc0","resolution":{"observed_at":"2026-06-27T12:46:05.332740Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.09360","last_updated":"2025-03-25T15:10:24Z","snapshot_observed_at":"2026-08-18T15:04:00.317464Z","submitted_at":"2024-12-12T15:27:47Z","title":"Doc2OracLL: Investigating the Impact of Documentation on LLM-based Test Oracle Generation","version":2},"cited_work":{"arxiv_id":"2412.09360","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.09360","snapshot_observed_at":"2026-07-08T13:54:58.535145Z","title":"Doc2OracLL: Investigating the Impact of Documentation on LLM-based Test Oracle Generation","venue":"cs.SE","work_id":"dd378572-cb8a-46f5-b071-dc53124c863c","year":2024},"citing_paper":{"arxiv_id":"2606.10417","last_updated":"2026-06-09T04:46:32Z","snapshot_observed_at":"2026-08-14T10:40:46.531578Z","submitted_at":"2026-06-09T04:46:32Z","title":"Beyond Coverage and Kill Scores: Empirically Measuring Test Suite Behavioural Gaps","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-06-27T12:46:05.332740Z"},"links":{"cited_paper":"/paper/2412.09360","citing_paper":"/paper/2606.10417"},"observation_digest":"sha256:83d73b0c712286b721b0080e07078b7d317182fd3e3f9cf16d80b3209b5021cf","observation_id":"c109ffb8-da3e-40bc-83d4-80e84098f30f","resolution":{"observed_at":"2026-07-03T06:17:42.125268Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T12:46:05.332740Z","title":"Behaviourally adequate software testing,","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2606.10417","last_updated":"2026-06-09T04:46:32Z","snapshot_observed_at":"2026-08-14T10:40:46.531578Z","submitted_at":"2026-06-09T04:46:32Z","title":"Beyond Coverage and Kill Scores: Empirically Measuring Test Suite Behavioural Gaps","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-06-27T12:46:05.332740Z"},"links":{"citing_paper":"/paper/2606.10417"},"observation_digest":"sha256:0f4249aa2107c8a1788d8fbfc612b8df86dc5e9ca61ddb18126fa5974427d87e","observation_id":"5434a1a9-fd26-4274-af64-24e6c1df0b81","resolution":{"observed_at":"2026-06-27T12:46:05.332740Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T12:46:05.332740Z","title":"Reliability of the path analysis testing strategy,","venue":null,"work_id":null,"year":1976},"citing_paper":{"arxiv_id":"2606.10417","last_updated":"2026-06-09T04:46:32Z","snapshot_observed_at":"2026-08-14T10:40:46.531578Z","submitted_at":"2026-06-09T04:46:32Z","title":"Beyond Coverage and Kill Scores: Empirically Measuring Test Suite Behavioural Gaps","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-06-27T12:46:05.332740Z"},"links":{"citing_paper":"/paper/2606.10417"},"observation_digest":"sha256:492fa9a1f1e4c76acf634743522f5a0472867ddac2dda3a90036c8686c634983","observation_id":"9f976172-700a-44dc-a237-9ab5a9933a24","resolution":{"observed_at":"2026-06-27T12:46:05.332740Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T12:46:05.332740Z","title":"The design of a prototype mutation system for program testing,","venue":null,"work_id":null,"year":1978},"citing_paper":{"arxiv_id":"2606.10417","last_updated":"2026-06-09T04:46:32Z","snapshot_observed_at":"2026-08-14T10:40:46.531578Z","submitted_at":"2026-06-09T04:46:32Z","title":"Beyond Coverage and Kill Scores: Empirically Measuring Test Suite Behavioural Gaps","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-06-27T12:46:05.332740Z"},"links":{"citing_paper":"/paper/2606.10417"},"observation_digest":"sha256:72f59ab6c3739d91b8ee4de2cfac4f704d11eec64ff3cc53e0ec6202b96919a5","observation_id":"832a2314-4cd1-4fc0-a10f-93400d42e43c","resolution":{"observed_at":"2026-06-27T12:46:05.332740Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T12:46:05.332740Z","title":"Software unit test coverage and adequacy,","venue":null,"work_id":null,"year":1997},"citing_paper":{"arxiv_id":"2606.10417","last_updated":"2026-06-09T04:46:32Z","snapshot_observed_at":"2026-08-14T10:40:46.531578Z","submitted_at":"2026-06-09T04:46:32Z","title":"Beyond Coverage and Kill Scores: Empirically Measuring Test Suite Behavioural Gaps","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-06-27T12:46:05.332740Z"},"links":{"citing_paper":"/paper/2606.10417"},"observation_digest":"sha256:ff2ee37dbfdcebcbc98936ad6023068cb03278bf10288ceb0ba3212d6d0e2431","observation_id":"b7564c5f-f57e-4d6e-9261-82dd6a2a6270","resolution":{"observed_at":"2026-06-27T12:46:05.332740Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T12:46:05.332740Z","title":"Mutation testing advances: an analysis and survey,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2606.10417","last_updated":"2026-06-09T04:46:32Z","snapshot_observed_at":"2026-08-14T10:40:46.531578Z","submitted_at":"2026-06-09T04:46:32Z","title":"Beyond Coverage and Kill Scores: Empirically Measuring Test Suite Behavioural Gaps","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-06-27T12:46:05.332740Z"},"links":{"citing_paper":"/paper/2606.10417"},"observation_digest":"sha256:ed4c8d4de51a6c946657e9ac6cd1f451282d329a83af2bfb043b5950e1c18eb4","observation_id":"86ed9154-0375-4dd3-9a61-5393fce38b70","resolution":{"observed_at":"2026-06-27T12:46:05.332740Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T12:46:05.332740Z","title":"Code coverage for suite eval- uation by developers,","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2606.10417","last_updated":"2026-06-09T04:46:32Z","snapshot_observed_at":"2026-08-14T10:40:46.531578Z","submitted_at":"2026-06-09T04:46:32Z","title":"Beyond Coverage and Kill Scores: Empirically Measuring Test Suite Behavioural Gaps","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-06-27T12:46:05.332740Z"},"links":{"citing_paper":"/paper/2606.10417"},"observation_digest":"sha256:fc75f3409b8e1c1955938fa4d0806658f0e31ba8b7db362af563bdae43a87433","observation_id":"2c55eace-9654-46e9-9e6d-4107d2c0a362","resolution":{"observed_at":"2026-06-27T12:46:05.332740Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T12:46:05.332740Z","title":"Are mutants a valid substitute for real faults in software testing?","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2606.10417","last_updated":"2026-06-09T04:46:32Z","snapshot_observed_at":"2026-08-14T10:40:46.531578Z","submitted_at":"2026-06-09T04:46:32Z","title":"Beyond Coverage and Kill Scores: Empirically Measuring Test Suite Behavioural Gaps","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-06-27T12:46:05.332740Z"},"links":{"citing_paper":"/paper/2606.10417"},"observation_digest":"sha256:7c98a7f7abf76205e5ade7fd403e51c7bf3cc7f88383e40df3ab34a9c9484188","observation_id":"5056a2db-ab5c-454d-8476-c012ebfe5fab","resolution":{"observed_at":"2026-06-27T12:46:05.332740Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T12:46:05.332740Z","title":"Functional testing, structural testing and code reading: What fault type do they each detect?","venue":null,"work_id":null,"year":2003},"citing_paper":{"arxiv_id":"2606.10417","last_updated":"2026-06-09T04:46:32Z","snapshot_observed_at":"2026-08-14T10:40:46.531578Z","submitted_at":"2026-06-09T04:46:32Z","title":"Beyond Coverage and Kill Scores: Empirically Measuring Test Suite Behavioural Gaps","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-06-27T12:46:05.332740Z"},"links":{"citing_paper":"/paper/2606.10417"},"observation_digest":"sha256:984bacde9056129d4081f18052fd0fd257b0990c3e6e9ecd98067f87a025ce5d","observation_id":"e8c5f0be-14ed-465e-8d62-fedd89027b38","resolution":{"observed_at":"2026-06-27T12:46:05.332740Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T12:46:05.332740Z","title":"How well do professional developers test with code coverage visualizations? an empirical study,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.10417","last_updated":"2026-06-09T04:46:32Z","snapshot_observed_at":"2026-08-14T10:40:46.531578Z","submitted_at":"2026-06-09T04:46:32Z","title":"Beyond Coverage and Kill Scores: Empirically Measuring Test Suite Behavioural Gaps","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-06-27T12:46:05.332740Z"},"links":{"citing_paper":"/paper/2606.10417"},"observation_digest":"sha256:6ee280147a58725a915a1d2212729aa7f74b743454a6859087626787823faae9","observation_id":"44a3556d-2896-453b-9aa8-cfd5d5d1a037","resolution":{"observed_at":"2026-06-27T12:46:05.332740Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T12:46:05.332740Z","title":"Assertions are strongly correlated with test suite effectiveness,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2606.10417","last_updated":"2026-06-09T04:46:32Z","snapshot_observed_at":"2026-08-14T10:40:46.531578Z","submitted_at":"2026-06-09T04:46:32Z","title":"Beyond Coverage and Kill Scores: Empirically Measuring Test Suite Behavioural Gaps","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-06-27T12:46:05.332740Z"},"links":{"citing_paper":"/paper/2606.10417"},"observation_digest":"sha256:f3215f5f6a0a98f16dec4fa09d18c9ae0a27bb6bb457fd35459e02db2cdfd503","observation_id":"8932392d-fa9c-47e8-87db-2ecb31756b6d","resolution":{"observed_at":"2026-06-27T12:46:05.332740Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T12:46:05.332740Z","title":"Does mutation testing improve testing practices?","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2606.10417","last_updated":"2026-06-09T04:46:32Z","snapshot_observed_at":"2026-08-14T10:40:46.531578Z","submitted_at":"2026-06-09T04:46:32Z","title":"Beyond Coverage and Kill Scores: Empirically Measuring Test Suite Behavioural Gaps","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-06-27T12:46:05.332740Z"},"links":{"citing_paper":"/paper/2606.10417"},"observation_digest":"sha256:12c9ea9587390c4faa9545a99f0876db78ad5a7098bb050c6bff87051bd00328","observation_id":"49ec2acd-4bca-498f-ba82-00648a0db2dd","resolution":{"observed_at":"2026-06-27T12:46:05.332740Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T12:46:05.332740Z","title":"Systematic mistake analysis of digital computer programs,","venue":null,"work_id":null,"year":1963},"citing_paper":{"arxiv_id":"2606.10417","last_updated":"2026-06-09T04:46:32Z","snapshot_observed_at":"2026-08-14T10:40:46.531578Z","submitted_at":"2026-06-09T04:46:32Z","title":"Beyond Coverage and Kill Scores: Empirically Measuring Test Suite Behavioural Gaps","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-06-27T12:46:05.332740Z"},"links":{"citing_paper":"/paper/2606.10417"},"observation_digest":"sha256:9e8385e2dfb78124e3862b36ad9749467618a1f948eb4d772b0f2c04bbd86c33","observation_id":"451a811c-080c-432d-b7f6-11936de0017e","resolution":{"observed_at":"2026-06-27T12:46:05.332740Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T12:46:05.332740Z","title":"Toward a theory of test data selection,","venue":null,"work_id":null,"year":1975},"citing_paper":{"arxiv_id":"2606.10417","last_updated":"2026-06-09T04:46:32Z","snapshot_observed_at":"2026-08-14T10:40:46.531578Z","submitted_at":"2026-06-09T04:46:32Z","title":"Beyond Coverage and Kill Scores: Empirically Measuring Test Suite Behavioural Gaps","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-06-27T12:46:05.332740Z"},"links":{"citing_paper":"/paper/2606.10417"},"observation_digest":"sha256:4ec40d5b322b6fd91f2c103f1072bdc2932190f6be676d66be58cb24a040218c","observation_id":"1250ff09-e3c3-4801-9eae-c91460ea8894","resolution":{"observed_at":"2026-06-27T12:46:05.332740Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T12:46:05.332740Z","title":"Foundations of software testing: dependability theory,","venue":null,"work_id":null,"year":1994},"citing_paper":{"arxiv_id":"2606.10417","last_updated":"2026-06-09T04:46:32Z","snapshot_observed_at":"2026-08-14T10:40:46.531578Z","submitted_at":"2026-06-09T04:46:32Z","title":"Beyond Coverage and Kill Scores: Empirically Measuring Test Suite Behavioural Gaps","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-06-27T12:46:05.332740Z"},"links":{"citing_paper":"/paper/2606.10417"},"observation_digest":"sha256:26c9938d4cf88ffd0670f8c751db9d968fd001babfab4e3c1e04a72524351dfb","observation_id":"3a1b0ed5-acee-47e6-a2a3-10ce649f0a27","resolution":{"observed_at":"2026-06-27T12:46:05.332740Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T12:46:05.332740Z","title":"Coverage is not strongly correlated with test suite effectiveness,","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2606.10417","last_updated":"2026-06-09T04:46:32Z","snapshot_observed_at":"2026-08-14T10:40:46.531578Z","submitted_at":"2026-06-09T04:46:32Z","title":"Beyond Coverage and Kill Scores: Empirically Measuring Test Suite Behavioural Gaps","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-06-27T12:46:05.332740Z"},"links":{"citing_paper":"/paper/2606.10417"},"observation_digest":"sha256:a3043b038a41ab5d3029d981844b4b7e3c8e9c36c3b0ff80034762a61eceb30c","observation_id":"9dbc7612-9923-4507-9d91-33e3ced34f17","resolution":{"observed_at":"2026-06-27T12:46:05.332740Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T12:46:05.332740Z","title":"The risks of coverage-directed test case generation,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2606.10417","last_updated":"2026-06-09T04:46:32Z","snapshot_observed_at":"2026-08-14T10:40:46.531578Z","submitted_at":"2026-06-09T04:46:32Z","title":"Beyond Coverage and Kill Scores: Empirically Measuring Test Suite Behavioural Gaps","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-06-27T12:46:05.332740Z"},"links":{"citing_paper":"/paper/2606.10417"},"observation_digest":"sha256:805ff492738c64e17ef402365d155f62cde13899f7735776c956197e0971bc6e","observation_id":"186a75d0-6f5f-4a45-8a69-620fdaec1309","resolution":{"observed_at":"2026-06-27T12:46:05.332740Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T12:46:05.332740Z","title":"Metamon: Finding inconsistencies be- tween program documentation and behavior using metamorphic llm queries,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.10417","last_updated":"2026-06-09T04:46:32Z","snapshot_observed_at":"2026-08-14T10:40:46.531578Z","submitted_at":"2026-06-09T04:46:32Z","title":"Beyond Coverage and Kill Scores: Empirically Measuring Test Suite Behavioural Gaps","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-06-27T12:46:05.332740Z"},"links":{"citing_paper":"/paper/2606.10417"},"observation_digest":"sha256:19b408a70569b20c500ea4b8ccceca82f88112ac5699f2034bd6b2979c9ff9e3","observation_id":"d0efaa5d-0554-412d-b555-2dc541ba51e8","resolution":{"observed_at":"2026-06-27T12:46:05.332740Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T12:46:05.332740Z","title":"Can large language models transform natural language intent into formal method postconditions?","venue":null,"work_id":null,"year":1912},"citing_paper":{"arxiv_id":"2606.10417","last_updated":"2026-06-09T04:46:32Z","snapshot_observed_at":"2026-08-14T10:40:46.531578Z","submitted_at":"2026-06-09T04:46:32Z","title":"Beyond Coverage and Kill Scores: Empirically Measuring Test Suite Behavioural Gaps","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-06-27T12:46:05.332740Z"},"links":{"citing_paper":"/paper/2606.10417"},"observation_digest":"sha256:87534d6935aa78aab5cef82e3a532db574c44f4004f576db8320d921d81dd09e","observation_id":"6d757542-30bf-4815-bd9a-1459f27fd40a","resolution":{"observed_at":"2026-06-27T12:46:05.332740Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T12:46:05.332740Z","title":"EvoSuite: Automatic test suite generation for object-oriented software,","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2606.10417","last_updated":"2026-06-09T04:46:32Z","snapshot_observed_at":"2026-08-14T10:40:46.531578Z","submitted_at":"2026-06-09T04:46:32Z","title":"Beyond Coverage and Kill Scores: Empirically Measuring Test Suite Behavioural Gaps","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-06-27T12:46:05.332740Z"},"links":{"citing_paper":"/paper/2606.10417"},"observation_digest":"sha256:7b267f9079ef8d132f5a60c8d9b82a1ad3ba863cd5850a0f1fead4aa9e7f0d09","observation_id":"bc681216-7134-4e67-8183-2e6336f0fc6f","resolution":{"observed_at":"2026-06-27T12:46:05.332740Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T12:46:05.332740Z","title":"Aster: Natural and multi-language unit test generation with llms,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.10417","last_updated":"2026-06-09T04:46:32Z","snapshot_observed_at":"2026-08-14T10:40:46.531578Z","submitted_at":"2026-06-09T04:46:32Z","title":"Beyond Coverage and Kill Scores: Empirically Measuring Test Suite Behavioural Gaps","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-06-27T12:46:05.332740Z"},"links":{"citing_paper":"/paper/2606.10417"},"observation_digest":"sha256:ab147b26a71fa1a39f583ace03f9ef62997dfb0a5fd330fc92078cc9a915e14b","observation_id":"962bdbd1-ccc8-4c83-92d5-9d354fd67f6f","resolution":{"observed_at":"2026-06-27T12:46:05.332740Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T12:46:05.332740Z","title":"Is mutation an appropriate tool for testing experiments?","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2606.10417","last_updated":"2026-06-09T04:46:32Z","snapshot_observed_at":"2026-08-14T10:40:46.531578Z","submitted_at":"2026-06-09T04:46:32Z","title":"Beyond Coverage and Kill Scores: Empirically Measuring Test Suite Behavioural Gaps","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-06-27T12:46:05.332740Z"},"links":{"citing_paper":"/paper/2606.10417"},"observation_digest":"sha256:9fc10f9b14d0d5c4383f33672d7b01324d143ac997409d32fa483d629c32f0a3","observation_id":"ff9a4332-1f33-48b8-8f8a-8594f96f7d3c","resolution":{"observed_at":"2026-06-27T12:46:05.332740Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1002/stvr.1497","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Checked coverage: an indicator for oracle quality,","venue":"Software Testing Verification and Reliability","work_id":"dd77321d-e755-474a-80b4-77bf085f2387","year":2013},"citing_paper":{"arxiv_id":"2606.10417","last_updated":"2026-06-09T04:46:32Z","snapshot_observed_at":"2026-08-14T10:40:46.531578Z","submitted_at":"2026-06-09T04:46:32Z","title":"Beyond Coverage and Kill Scores: Empirically Measuring Test Suite Behavioural Gaps","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-06-27T12:46:05.332740Z"},"links":{"citing_paper":"/paper/2606.10417"},"observation_digest":"sha256:1bbdde0ec94b6f278a6f8de26f2123a3ace4993c52a0b41f9982e6460cfd0c58","observation_id":"618038f1-ec7d-47f0-8157-03cdab3e10e7","resolution":{"observed_at":"2026-06-27T12:50:56.058311Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T12:46:05.332740Z","title":"A compre- hensive study of pseudo-tested methods,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2606.10417","last_updated":"2026-06-09T04:46:32Z","snapshot_observed_at":"2026-08-14T10:40:46.531578Z","submitted_at":"2026-06-09T04:46:32Z","title":"Beyond Coverage and Kill Scores: Empirically Measuring Test Suite Behavioural Gaps","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-06-27T12:46:05.332740Z"},"links":{"citing_paper":"/paper/2606.10417"},"observation_digest":"sha256:1363c9903e9caba3a8d5e4f5fa2e78a89a14757e9fddb4158cccdc39e112b27d","observation_id":"571d9e7c-fcd7-47a5-a3d3-a97916b7182e","resolution":{"observed_at":"2026-06-27T12:46:05.332740Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T12:46:05.332740Z","title":"Where tests fall short: empirically analyzing oracle gaps in covered code,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.10417","last_updated":"2026-06-09T04:46:32Z","snapshot_observed_at":"2026-08-14T10:40:46.531578Z","submitted_at":"2026-06-09T04:46:32Z","title":"Beyond Coverage and Kill Scores: Empirically Measuring Test Suite Behavioural Gaps","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-06-27T12:46:05.332740Z"},"links":{"citing_paper":"/paper/2606.10417"},"observation_digest":"sha256:679129df1ef441d9f20fbe2b6104c41d0b38b0d047da4d65a50d117f568e28ba","observation_id":"38f47537-ed05-4745-a80b-d769ac17457e","resolution":{"observed_at":"2026-06-27T12:46:05.332740Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T12:46:05.332740Z","title":"Automatically gen- erating test cases for safety-critical software via symbolic execution,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.10417","last_updated":"2026-06-09T04:46:32Z","snapshot_observed_at":"2026-08-14T10:40:46.531578Z","submitted_at":"2026-06-09T04:46:32Z","title":"Beyond Coverage and Kill Scores: Empirically Measuring Test Suite Behavioural Gaps","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-06-27T12:46:05.332740Z"},"links":{"citing_paper":"/paper/2606.10417"},"observation_digest":"sha256:21dc60883106fd3a8af688384e0f50caef9469770096e172d63d4ac8e5e7edb4","observation_id":"8381f91d-c4bb-41e3-80cb-d14d6c39ed4a","resolution":{"observed_at":"2026-06-27T12:46:05.332740Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T12:46:05.332740Z","title":"Call me maybe: Using NLP to automatically generate unit test cases respecting temporal con- straints,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2606.10417","last_updated":"2026-06-09T04:46:32Z","snapshot_observed_at":"2026-08-14T10:40:46.531578Z","submitted_at":"2026-06-09T04:46:32Z","title":"Beyond Coverage and Kill Scores: Empirically Measuring Test Suite Behavioural Gaps","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-06-27T12:46:05.332740Z"},"links":{"citing_paper":"/paper/2606.10417"},"observation_digest":"sha256:f48429f40bb1c967128b84c7d641fbf2ac1987926f83fa25be45f9081ee1bfbf","observation_id":"64a8201d-b313-4c96-b3bf-32d758a3cb38","resolution":{"observed_at":"2026-06-27T12:46:05.332740Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T12:46:05.332740Z","title":"Nanofuzz: A usable tool for automatic test generation,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.10417","last_updated":"2026-06-09T04:46:32Z","snapshot_observed_at":"2026-08-14T10:40:46.531578Z","submitted_at":"2026-06-09T04:46:32Z","title":"Beyond Coverage and Kill Scores: Empirically Measuring Test Suite Behavioural Gaps","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-06-27T12:46:05.332740Z"},"links":{"citing_paper":"/paper/2606.10417"},"observation_digest":"sha256:16eba01119d784d4d829413af465d5e545e76885563e24e397dbda390244580b","observation_id":"f5f2f8df-b70f-497b-bc89-c55bfee63eff","resolution":{"observed_at":"2026-06-27T12:46:05.332740Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"1643.36163","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-03T06:17:42.155213Z","title":"1114–1126","venue":null,"work_id":"c0e47063-dfcf-4b8c-9f88-23556569d180","year":2023},"citing_paper":{"arxiv_id":"2606.10417","last_updated":"2026-06-09T04:46:32Z","snapshot_observed_at":"2026-08-14T10:40:46.531578Z","submitted_at":"2026-06-09T04:46:32Z","title":"Beyond Coverage and Kill Scores: Empirically Measuring Test Suite Behavioural Gaps","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-06-27T12:46:05.332740Z"},"links":{"citing_paper":"/paper/2606.10417"},"observation_digest":"sha256:62ac962b7bd6847245891a26498372b1d759c78457a84ff92274c1f3260a0ef5","observation_id":"693dd1eb-6778-4e8f-9115-ded983883b30","resolution":{"observed_at":"2026-07-03T06:17:42.157616Z","resolver_source":"arxiv_id","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T12:46:05.332740Z","title":"Feedback-directed random test generation,","venue":null,"work_id":null,"year":2007},"citing_paper":{"arxiv_id":"2606.10417","last_updated":"2026-06-09T04:46:32Z","snapshot_observed_at":"2026-08-14T10:40:46.531578Z","submitted_at":"2026-06-09T04:46:32Z","title":"Beyond Coverage and Kill Scores: Empirically Measuring Test Suite Behavioural Gaps","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-06-27T12:46:05.332740Z"},"links":{"citing_paper":"/paper/2606.10417"},"observation_digest":"sha256:5ae52459f38a21d854e56be3d9dfbc437f92698b006ef73c25890faa61c98a2b","observation_id":"2e216a49-b5ed-4ad2-89eb-8fa12a4faba1","resolution":{"observed_at":"2026-06-27T12:46:05.332740Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T12:46:05.332740Z","title":"Chatunitest: A framework for llm-based test generation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.10417","last_updated":"2026-06-09T04:46:32Z","snapshot_observed_at":"2026-08-14T10:40:46.531578Z","submitted_at":"2026-06-09T04:46:32Z","title":"Beyond Coverage and Kill Scores: Empirically Measuring Test Suite Behavioural Gaps","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-06-27T12:46:05.332740Z"},"links":{"citing_paper":"/paper/2606.10417"},"observation_digest":"sha256:4e6b18c409393b52707802f33ab2ad3599fdd65167550b8f33bace711795f4a6","observation_id":"f30692a4-693b-4fca-8a6c-f32aa523c909","resolution":{"observed_at":"2026-06-27T12:46:05.332740Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T12:46:05.332740Z","title":"Automatic generation of oracles for exceptional behaviors,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2606.10417","last_updated":"2026-06-09T04:46:32Z","snapshot_observed_at":"2026-08-14T10:40:46.531578Z","submitted_at":"2026-06-09T04:46:32Z","title":"Beyond Coverage and Kill Scores: Empirically Measuring Test Suite Behavioural Gaps","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-06-27T12:46:05.332740Z"},"links":{"citing_paper":"/paper/2606.10417"},"observation_digest":"sha256:3d57ae56a2b2c09dbcbf6867bfe3a6a7380570d792942adb0263b11d7c781cdb","observation_id":"752e052d-bcb2-4b32-a335-52d6d7aec195","resolution":{"observed_at":"2026-06-27T12:46:05.332740Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T12:46:05.332740Z","title":"Translating code comments to procedure spec- ifications,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2606.10417","last_updated":"2026-06-09T04:46:32Z","snapshot_observed_at":"2026-08-14T10:40:46.531578Z","submitted_at":"2026-06-09T04:46:32Z","title":"Beyond Coverage and Kill Scores: Empirically Measuring Test Suite Behavioural Gaps","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-06-27T12:46:05.332740Z"},"links":{"citing_paper":"/paper/2606.10417"},"observation_digest":"sha256:4fd8189104232377b9b04c8f0ac23405522a5c414a48e14faf17e974fe9fcf90","observation_id":"d3c3ac90-01ea-447b-9341-48e1762079c8","resolution":{"observed_at":"2026-06-27T12:46:05.332740Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.21161","last_updated":"2025-04-29T20:23:56Z","snapshot_observed_at":"2026-08-20T10:04:49.365791Z","submitted_at":"2025-04-29T20:23:56Z","title":"Automated Test Generation from Program Documentation Encoded in Code Comments","version":1},"cited_work":{"arxiv_id":"2504.21161","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2504.21161","snapshot_observed_at":"2026-07-03T06:17:42.150037Z","title":"Automated test generation from program documentation encoded in code comments,","venue":null,"work_id":"670e586f-5267-4120-b560-315c784d2200","year":2025},"citing_paper":{"arxiv_id":"2606.10417","last_updated":"2026-06-09T04:46:32Z","snapshot_observed_at":"2026-08-14T10:40:46.531578Z","submitted_at":"2026-06-09T04:46:32Z","title":"Beyond Coverage and Kill Scores: Empirically Measuring Test Suite Behavioural Gaps","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-06-27T12:46:05.332740Z"},"links":{"cited_paper":"/paper/2504.21161","citing_paper":"/paper/2606.10417"},"observation_digest":"sha256:1912d64adaa1f390572eef1d582d29fa1d17cfb9358020f12f15cbafe4b270b8","observation_id":"bf0dd2cd-aa89-49a3-bca1-ac90e08738fa","resolution":{"observed_at":"2026-07-03T06:17:42.152518Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2506.07486","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-03T06:17:42.154150Z","title":"A framework for creating non-regressive test cases via branch consistency analysis driven by descriptions,","venue":null,"work_id":"9a697d8b-f0bc-426e-87a8-3b042e133bd4","year":2025},"citing_paper":{"arxiv_id":"2606.10417","last_updated":"2026-06-09T04:46:32Z","snapshot_observed_at":"2026-08-14T10:40:46.531578Z","submitted_at":"2026-06-09T04:46:32Z","title":"Beyond Coverage and Kill Scores: Empirically Measuring Test Suite Behavioural Gaps","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-06-27T12:46:05.332740Z"},"links":{"citing_paper":"/paper/2606.10417"},"observation_digest":"sha256:e744d3130230c2d8bfb5f2eab1032f5e47d9af6b98645d6316103dd053584699","observation_id":"5b39c486-f7fc-4769-8cb5-ee31d9d107d1","resolution":{"observed_at":"2026-07-03T06:17:42.156458Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.00215","last_updated":"2026-07-29T19:12:44Z","snapshot_observed_at":"2026-08-18T09:09:35.640499Z","submitted_at":"2025-10-31T19:22:54Z","title":"DocPrism: Multi-lingual Detection of Incorrectness Inconsistencies between Code and Documentation","version":2},"cited_work":{"arxiv_id":"2511.00215","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2511.00215","snapshot_observed_at":"2026-07-31T01:08:52.634113Z","title":"Docprism: Local categorization and external filtering to identify relevant code-documentation inconsistencies,","venue":null,"work_id":"bb3363ae-365a-4d67-94cd-4c806872cffa","year":2025},"citing_paper":{"arxiv_id":"2606.10417","last_updated":"2026-06-09T04:46:32Z","snapshot_observed_at":"2026-08-14T10:40:46.531578Z","submitted_at":"2026-06-09T04:46:32Z","title":"Beyond Coverage and Kill Scores: Empirically Measuring Test Suite Behavioural Gaps","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-06-27T12:46:05.332740Z"},"links":{"cited_paper":"/paper/2511.00215","citing_paper":"/paper/2606.10417"},"observation_digest":"sha256:623db9e1d653952868d367b1111c7728c41243e1a68812fc0669da0960304752","observation_id":"52ee9368-d91e-4ca7-b4f1-0b2093b58ccb","resolution":{"observed_at":"2026-07-31T01:08:52.634113Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T12:46:05.332740Z","title":"Natural language generation and understanding of big code for ai-assisted programming: A review,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.10417","last_updated":"2026-06-09T04:46:32Z","snapshot_observed_at":"2026-08-14T10:40:46.531578Z","submitted_at":"2026-06-09T04:46:32Z","title":"Beyond Coverage and Kill Scores: Empirically Measuring Test Suite Behavioural Gaps","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-06-27T12:46:05.332740Z"},"links":{"citing_paper":"/paper/2606.10417"},"observation_digest":"sha256:840096fb533f127f814e9489ea2a0ca6c6d84ae26f22968656fe0eae36a5b55e","observation_id":"99ee3339-689a-48de-88b2-b87cf3968164","resolution":{"observed_at":"2026-06-27T12:46:05.332740Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T12:46:05.332740Z","title":"Communicating study design trade-offs in software engineering,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.10417","last_updated":"2026-06-09T04:46:32Z","snapshot_observed_at":"2026-08-14T10:40:46.531578Z","submitted_at":"2026-06-09T04:46:32Z","title":"Beyond Coverage and Kill Scores: Empirically Measuring Test Suite Behavioural Gaps","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-06-27T12:46:05.332740Z"},"links":{"citing_paper":"/paper/2606.10417"},"observation_digest":"sha256:8f21eb086ab012a04df650ac82e3bef55b382ba5b45d0afe8163fd5b57713a56","observation_id":"1ef0a625-da33-44e2-94bf-0b7b68c9d606","resolution":{"observed_at":"2026-06-27T12:46:05.332740Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":"2505.09388","doi":"10.1016/j.aiopen.2022.12","metadata_source":"pith","pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Qwen3 Technical Report","venue":"cs.CL","work_id":"25a4e30c-1232-48e7-9925-02fa12ba7c9e","year":2025},"citing_paper":{"arxiv_id":"2606.10417","last_updated":"2026-06-09T04:46:32Z","snapshot_observed_at":"2026-08-14T10:40:46.531578Z","submitted_at":"2026-06-09T04:46:32Z","title":"Beyond Coverage and Kill Scores: Empirically Measuring Test Suite Behavioural Gaps","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-06-27T12:46:05.332740Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2606.10417"},"observation_digest":"sha256:bbbad262810c6296450808ae99a8777154ab0264652f12c058806269fd11ed09","observation_id":"dc816bb5-2a82-4ce6-94f6-286bf92a32a9","resolution":{"observed_at":"2026-07-03T06:17:42.128752Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T12:46:05.332740Z","title":"Defects4J: A database of existing faults to enable controlled testing studies for java programs,","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2606.10417","last_updated":"2026-06-09T04:46:32Z","snapshot_observed_at":"2026-08-14T10:40:46.531578Z","submitted_at":"2026-06-09T04:46:32Z","title":"Beyond Coverage and Kill Scores: Empirically Measuring Test Suite Behavioural Gaps","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-06-27T12:46:05.332740Z"},"links":{"citing_paper":"/paper/2606.10417"},"observation_digest":"sha256:5cd50b77d53fd3190a47a3652f30516f55c206668908fd96aaadd2da4511b5c5","observation_id":"8ace8e99-794b-4662-958f-75e1930793dd","resolution":{"observed_at":"2026-06-27T12:46:05.332740Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T12:46:05.332740Z","title":"JaCoCo Java Code Coverage Li- brary,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.10417","last_updated":"2026-06-09T04:46:32Z","snapshot_observed_at":"2026-08-14T10:40:46.531578Z","submitted_at":"2026-06-09T04:46:32Z","title":"Beyond Coverage and Kill Scores: Empirically Measuring Test Suite Behavioural Gaps","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-06-27T12:46:05.332740Z"},"links":{"citing_paper":"/paper/2606.10417"},"observation_digest":"sha256:ce44ecdd5ae91507bced44d014e4318018ed80f260606549c89efc91c2b523fe","observation_id":"1510b7b9-beae-4b39-acf6-860855e9b9aa","resolution":{"observed_at":"2026-06-27T12:46:05.332740Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T12:46:05.332740Z","title":"PIT: Mutation Testing for Java,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.10417","last_updated":"2026-06-09T04:46:32Z","snapshot_observed_at":"2026-08-14T10:40:46.531578Z","submitted_at":"2026-06-09T04:46:32Z","title":"Beyond Coverage and Kill Scores: Empirically Measuring Test Suite Behavioural Gaps","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-06-27T12:46:05.332740Z"},"links":{"citing_paper":"/paper/2606.10417"},"observation_digest":"sha256:d67efbd1e2bfed7e76c9f2c48a273655ab059308e96aa1a726119c3009dfdeb7","observation_id":"4a19cfab-aa91-4b22-980a-60f5674fa711","resolution":{"observed_at":"2026-06-27T12:46:05.332740Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T12:46:05.332740Z","title":"Judging LLM-as-a-judge with MT-bench and chatbot arena,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.10417","last_updated":"2026-06-09T04:46:32Z","snapshot_observed_at":"2026-08-14T10:40:46.531578Z","submitted_at":"2026-06-09T04:46:32Z","title":"Beyond Coverage and Kill Scores: Empirically Measuring Test Suite Behavioural Gaps","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-06-27T12:46:05.332740Z"},"links":{"citing_paper":"/paper/2606.10417"},"observation_digest":"sha256:35bb4104fca29cd7da85da6ca329cbaef2698207c908792c3b3887b6724ae50a","observation_id":"5b7686e2-e9f2-4d84-8345-5949ee530f4e","resolution":{"observed_at":"2026-06-27T12:46:05.332740Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2601.08584","last_updated":"2026-01-13T14:06:03Z","snapshot_observed_at":"2026-08-12T22:11:58.919874Z","submitted_at":"2026-01-13T14:06:03Z","title":"Ministral 3","version":1},"cited_work":{"arxiv_id":"2601.08584","doi":"10.48550/arxiv.2601.08584","metadata_source":"pith","pith_arxiv_id":"2601.08584","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Ministral 3","venue":"cs.CL","work_id":"6f314463-0f42-4eea-a5c3-607e733d6afe","year":2026},"citing_paper":{"arxiv_id":"2606.10417","last_updated":"2026-06-09T04:46:32Z","snapshot_observed_at":"2026-08-14T10:40:46.531578Z","submitted_at":"2026-06-09T04:46:32Z","title":"Beyond Coverage and Kill Scores: Empirically Measuring Test Suite Behavioural Gaps","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-06-27T12:46:05.332740Z"},"links":{"cited_paper":"/paper/2601.08584","citing_paper":"/paper/2606.10417"},"observation_digest":"sha256:443fecb5bab00d61a19ed0154e870c557e5303e1b7da5863cc994862a36e1d8c","observation_id":"83f14c81-7b3e-40f4-9f3e-93cf6bdaf51e","resolution":{"observed_at":"2026-07-03T06:17:42.133759Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-07-11T05:19:23.713861+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T05:19:23.713861+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T12:46:05.332740Z","title":"Can llms replace manual annotation of software engineering artifacts?","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.10417","last_updated":"2026-06-09T04:46:32Z","snapshot_observed_at":"2026-08-14T10:40:46.531578Z","submitted_at":"2026-06-09T04:46:32Z","title":"Beyond Coverage and Kill Scores: Empirically Measuring Test Suite Behavioural Gaps","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-06-27T12:46:05.332740Z"},"links":{"citing_paper":"/paper/2606.10417"},"observation_digest":"sha256:bb2d971f54254e830d9e78cddd9a02ff715008642eb7d00751962c7e220d6f89","observation_id":"e2ef37a7-31af-4d24-a8d0-3f52b8ed02d3","resolution":{"observed_at":"2026-06-27T12:46:05.332740Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T12:46:05.332740Z","title":"Llm-as-a-judge for software engineering: Literature review, vision, and the road ahead,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.10417","last_updated":"2026-06-09T04:46:32Z","snapshot_observed_at":"2026-08-14T10:40:46.531578Z","submitted_at":"2026-06-09T04:46:32Z","title":"Beyond Coverage and Kill Scores: Empirically Measuring Test Suite Behavioural Gaps","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-06-27T12:46:05.332740Z"},"links":{"citing_paper":"/paper/2606.10417"},"observation_digest":"sha256:32e6d5b3b082c2f8cc485cea2a4018f0b6e5ec6644ee9934918e1de60aea13d0","observation_id":"fb025c5c-aa60-4b90-93f0-e0fbcf3481bb","resolution":{"observed_at":"2026-06-27T12:46:05.332740Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2505.20854","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-03T06:17:42.150584Z","title":"An llm-as-judge metric for bridging the gap with human evaluation in se tasks","venue":null,"work_id":"0f6795da-3118-442b-ba23-f6959328463c","year":2025},"citing_paper":{"arxiv_id":"2606.10417","last_updated":"2026-06-09T04:46:32Z","snapshot_observed_at":"2026-08-14T10:40:46.531578Z","submitted_at":"2026-06-09T04:46:32Z","title":"Beyond Coverage and Kill Scores: Empirically Measuring Test Suite Behavioural Gaps","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-06-27T12:46:05.332740Z"},"links":{"citing_paper":"/paper/2606.10417"},"observation_digest":"sha256:d3a72f1683c6494ff3bb74ceeac5bab49f7d91946d1251b0cd16f637a8744588","observation_id":"29812bb2-c7b9-4668-b386-55c5f420ba9f","resolution":{"observed_at":"2026-07-03T06:17:42.152904Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T12:46:05.332740Z","title":"Evaluation of sampling and cross-validation tuning strategies for regional-scale machine learning classification,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2606.10417","last_updated":"2026-06-09T04:46:32Z","snapshot_observed_at":"2026-08-14T10:40:46.531578Z","submitted_at":"2026-06-09T04:46:32Z","title":"Beyond Coverage and Kill Scores: Empirically Measuring Test Suite Behavioural Gaps","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-06-27T12:46:05.332740Z"},"links":{"citing_paper":"/paper/2606.10417"},"observation_digest":"sha256:4e404a333c78f3296b96927953ae5640ff83272f12e862fee4d1f4cbd172ff17","observation_id":"bf82c0e5-1f79-4a6c-ae78-ef3acceaa028","resolution":{"observed_at":"2026-06-27T12:46:05.332740Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T12:46:05.332740Z","title":"Interrater reliability: the kappa statistic,","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2606.10417","last_updated":"2026-06-09T04:46:32Z","snapshot_observed_at":"2026-08-14T10:40:46.531578Z","submitted_at":"2026-06-09T04:46:32Z","title":"Beyond Coverage and Kill Scores: Empirically Measuring Test Suite Behavioural Gaps","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-06-27T12:46:05.332740Z"},"links":{"citing_paper":"/paper/2606.10417"},"observation_digest":"sha256:941731e189ba6ecb3ee8120c6e78127810b5fbbb8fdd8896b68ea99ae8a69eef","observation_id":"5e8728ac-3478-4b75-ab64-5fe3ab6048dc","resolution":{"observed_at":"2026-06-27T12:46:05.332740Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T12:46:05.332740Z","title":"A tutorial on sample size calculation for inter-rater and intra-rater agreement studies,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.10417","last_updated":"2026-06-09T04:46:32Z","snapshot_observed_at":"2026-08-14T10:40:46.531578Z","submitted_at":"2026-06-09T04:46:32Z","title":"Beyond Coverage and Kill Scores: Empirically Measuring Test Suite Behavioural Gaps","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-06-27T12:46:05.332740Z"},"links":{"citing_paper":"/paper/2606.10417"},"observation_digest":"sha256:9c6b1eb11f9e8edfe3e8f29928507c52c3e6da25278b577182dd632df75e1c3c","observation_id":"4e35a75d-21ff-447b-8191-cd14464a0836","resolution":{"observed_at":"2026-06-27T12:46:05.332740Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T12:46:05.332740Z","title":null,"venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2606.10417","last_updated":"2026-06-09T04:46:32Z","snapshot_observed_at":"2026-08-14T10:40:46.531578Z","submitted_at":"2026-06-09T04:46:32Z","title":"Beyond Coverage and Kill Scores: Empirically Measuring Test Suite Behavioural Gaps","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-06-27T12:46:05.332740Z"},"links":{"citing_paper":"/paper/2606.10417"},"observation_digest":"sha256:1d5457c8ab6cefea46e85ae8eda5d7e16ff63a11ae34f88333932a9a5f3369c6","observation_id":"e786617f-b9c1-4ec6-bd65-9dcf26553d9a","resolution":{"observed_at":"2026-06-27T12:46:05.332740Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T12:46:05.332740Z","title":"Mutation testing advances: An analysis and survey,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2606.10417","last_updated":"2026-06-09T04:46:32Z","snapshot_observed_at":"2026-08-14T10:40:46.531578Z","submitted_at":"2026-06-09T04:46:32Z","title":"Beyond Coverage and Kill Scores: Empirically Measuring Test Suite Behavioural Gaps","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-06-27T12:46:05.332740Z"},"links":{"citing_paper":"/paper/2606.10417"},"observation_digest":"sha256:76243ffea88d5a0ba5fb38eaf0e1dabf2bd122caf33115aac3356d56ec0e7611","observation_id":"08a3cd77-7329-454d-bf82-7cfe01d6850f","resolution":{"observed_at":"2026-06-27T12:46:05.332740Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T12:46:05.332740Z","title":"Spearman,The proof and measurement of association between two things.Appleton-Century-Crofts, 1961","venue":null,"work_id":null,"year":1961},"citing_paper":{"arxiv_id":"2606.10417","last_updated":"2026-06-09T04:46:32Z","snapshot_observed_at":"2026-08-14T10:40:46.531578Z","submitted_at":"2026-06-09T04:46:32Z","title":"Beyond Coverage and Kill Scores: Empirically Measuring Test Suite Behavioural Gaps","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-06-27T12:46:05.332740Z"},"links":{"citing_paper":"/paper/2606.10417"},"observation_digest":"sha256:ba97c0c5069d59123658848dac069d49236c15d93652cfa3ac77e3b933ac71f5","observation_id":"bc2f15a9-2630-489f-b869-f1ce151d475c","resolution":{"observed_at":"2026-06-27T12:46:05.332740Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2606.10417","last_updated":"2026-06-09T04:46:32Z","latest_version":1,"primary_category":"cs.SE","snapshot_observed_at":"2026-08-14T10:40:46.531578Z","submitted_at":"2026-06-09T04:46:32Z","title":"Beyond Coverage and Kill Scores: Empirically Measuring Test Suite Behavioural Gaps"},"reference_resolution":{"displayed":57,"state_counts":{"malformed_identifier":1,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":48,"verified_exact":7,"verified_fuzzy":0},"total_outbound_references":57},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"thesis":"As of 22 August 2026, this Paper Citation Record lists 57 of 57 outbound references and 0 inbound Pith citation observations for arXiv:2606.10417."}