{"as_of":"2026-08-07T18:30:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:fea0d2d46d79e4e3b4c26ec997ec9d5c14b1de58ddbfd7276c672a44cf250bc2","coverage":[{"denominator":32,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":32,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T05:59:44.334749Z","state":"measured"},{"denominator":32,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":32,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2509.04644/citation-record","integrity":"/paper/2509.04644/integrity","json":"/paper/2509.04644/citation-record.json","paper":"/paper/2509.04644"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T05:59:45.974241Z","title":"• DeepSeek-Chat: A domain-specific model optimized for developer tasks, with enhanced per formance on programming-related queries and structural code outputs","venue":null,"work_id":"2a128a95-b1ad-44a0-8ca3-c34029709259","year":null},"citing_paper":{"arxiv_id":"2509.04644","last_updated":"2025-09-04T20:02:52Z","snapshot_observed_at":"2026-08-07T10:58:14.958394Z","submitted_at":"2025-09-04T20:02:52Z","title":"Comparative Evaluation of Large Language Models for Test-Skeleton Generation","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-05T05:59:41.344770Z"},"links":{"citing_paper":"/paper/2509.04644"},"observation_digest":"sha256:69ef28132ab080bad02aa11fde39d50b9b49d58fe141c174a2fa423815979337","observation_id":"a56c354b-4765-4186-9b04-75a0ca420820","resolution":{"observed_at":"2026-08-05T05:59:45.977040Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T05:59:45.966442Z","title":null,"venue":null,"work_id":"00e22f73-365c-4dc9-aa93-1773979ece6c","year":2048},"citing_paper":{"arxiv_id":"2509.04644","last_updated":"2025-09-04T20:02:52Z","snapshot_observed_at":"2026-08-07T10:58:14.958394Z","submitted_at":"2025-09-04T20:02:52Z","title":"Comparative Evaluation of Large Language Models for Test-Skeleton Generation","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-05T05:59:41.410462Z"},"links":{"citing_paper":"/paper/2509.04644"},"observation_digest":"sha256:8b116ed2898b98449acc463febf47b01d30063589d89b7a50d4eda3ae1b8ec42","observation_id":"1f18e828-bd31-46e6-8bd6-5b05e1cf722d","resolution":{"observed_at":"2026-08-05T05:59:45.969241Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T05:59:45.958970Z","title":"This metric captures how completely the model covered the methods of the class","venue":null,"work_id":"96a779a5-9d19-42b8-8caf-d044da2f3d5b","year":null},"citing_paper":{"arxiv_id":"2509.04644","last_updated":"2025-09-04T20:02:52Z","snapshot_observed_at":"2026-08-07T10:58:14.958394Z","submitted_at":"2025-09-04T20:02:52Z","title":"Comparative Evaluation of Large Language Models for Test-Skeleton Generation","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-05T05:59:41.507627Z"},"links":{"citing_paper":"/paper/2509.04644"},"observation_digest":"sha256:ce930193d9a65b228e9b51a23f0b55ca6cffa5ccdf5e563a239607fa37331f38","observation_id":"48b3af5c-2e3f-45bc-8270-30cbed800f3d","resolution":{"observed_at":"2026-08-05T05:59:45.961628Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T05:59:45.951589Z","title":"The reviewer assessed each generated skeleton using six dimensions, scoring on a 1–5 scale:","venue":null,"work_id":"5e35c105-10a0-425b-94ab-7466d175f03f","year":null},"citing_paper":{"arxiv_id":"2509.04644","last_updated":"2025-09-04T20:02:52Z","snapshot_observed_at":"2026-08-07T10:58:14.958394Z","submitted_at":"2025-09-04T20:02:52Z","title":"Comparative Evaluation of Large Language Models for Test-Skeleton Generation","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-05T05:59:41.630098Z"},"links":{"citing_paper":"/paper/2509.04644"},"observation_digest":"sha256:5ccb22250f0a1c441ae85a8ddad678cc0a33a2814cccd241c87ff096481d65b8","observation_id":"486d227c-6b63-4476-8e9e-092fa731a294","resolution":{"observed_at":"2026-08-05T05:59:45.954259Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T05:59:45.943702Z","title":null,"venue":null,"work_id":"38803e56-e217-4b93-8a68-c49af0c90194","year":null},"citing_paper":{"arxiv_id":"2509.04644","last_updated":"2025-09-04T20:02:52Z","snapshot_observed_at":"2026-08-07T10:58:14.958394Z","submitted_at":"2025-09-04T20:02:52Z","title":"Comparative Evaluation of Large Language Models for Test-Skeleton Generation","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-05T05:59:41.722768Z"},"links":{"citing_paper":"/paper/2509.04644"},"observation_digest":"sha256:747055628e591b6dc9fc567d9ccbf6eed72a092441b21f6a8db4a9d28bd5d05e","observation_id":"2aa9f794-00e1-49da-bd61-c0556f896be5","resolution":{"observed_at":"2026-08-05T05:59:45.946549Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T05:59:45.935860Z","title":null,"venue":null,"work_id":"eb88fe11-2efe-455b-9cb4-9d7728750aa5","year":null},"citing_paper":{"arxiv_id":"2509.04644","last_updated":"2025-09-04T20:02:52Z","snapshot_observed_at":"2026-08-07T10:58:14.958394Z","submitted_at":"2025-09-04T20:02:52Z","title":"Comparative Evaluation of Large Language Models for Test-Skeleton Generation","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-05T05:59:41.807785Z"},"links":{"citing_paper":"/paper/2509.04644"},"observation_digest":"sha256:b3f0bf8386301852df322e55f4a9baff08e6db828e67168e9e3095b6938c1c03","observation_id":"23c1419b-ba06-44f3-89b2-18278065f3e9","resolution":{"observed_at":"2026-08-05T05:59:45.938308Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T05:59:45.928546Z","title":null,"venue":null,"work_id":"4e2658ba-aea5-4618-bbaf-55301975e64c","year":null},"citing_paper":{"arxiv_id":"2509.04644","last_updated":"2025-09-04T20:02:52Z","snapshot_observed_at":"2026-08-07T10:58:14.958394Z","submitted_at":"2025-09-04T20:02:52Z","title":"Comparative Evaluation of Large Language Models for Test-Skeleton Generation","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-05T05:59:41.881018Z"},"links":{"citing_paper":"/paper/2509.04644"},"observation_digest":"sha256:21b9ca943902caebf6d6f1cfe3ed721e2e04ebc450fbd495ab3fcbc98bf7a212","observation_id":"be35ffbd-2315-4430-b548-def0f3e66a13","resolution":{"observed_at":"2026-08-05T05:59:45.931073Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T05:59:45.920819Z","title":null,"venue":null,"work_id":"9bb0f5c3-d698-447e-a5c2-57c39af1d33a","year":null},"citing_paper":{"arxiv_id":"2509.04644","last_updated":"2025-09-04T20:02:52Z","snapshot_observed_at":"2026-08-07T10:58:14.958394Z","submitted_at":"2025-09-04T20:02:52Z","title":"Comparative Evaluation of Large Language Models for Test-Skeleton Generation","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-05T05:59:41.972822Z"},"links":{"citing_paper":"/paper/2509.04644"},"observation_digest":"sha256:c532e29f12fe909c15e9a5c877dc478fba5b18ee33f70f577a149f47c402ed81","observation_id":"54b6d876-ec38-424e-a6c7-00f8b0975f9f","resolution":{"observed_at":"2026-08-05T05:59:45.923339Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T05:59:45.913601Z","title":null,"venue":null,"work_id":"9b01e0c5-db1c-4952-83d5-a5be853809a7","year":null},"citing_paper":{"arxiv_id":"2509.04644","last_updated":"2025-09-04T20:02:52Z","snapshot_observed_at":"2026-08-07T10:58:14.958394Z","submitted_at":"2025-09-04T20:02:52Z","title":"Comparative Evaluation of Large Language Models for Test-Skeleton Generation","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-05T05:59:42.063694Z"},"links":{"citing_paper":"/paper/2509.04644"},"observation_digest":"sha256:886b23f668945566b85d8c453d401b7f65d9c26186c5550f0642b117e1b62d03","observation_id":"7968bccd-2a55-494f-a818-0eeb245f31bb","resolution":{"observed_at":"2026-08-05T05:59:45.915965Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T05:59:45.905674Z","title":"The expert review focused on identifying semantic misinterpretations, structural flaws, and usability within the skeletons generated by the models","venue":null,"work_id":"aa70f3d7-178c-4b24-82ce-fa0594a51117","year":null},"citing_paper":{"arxiv_id":"2509.04644","last_updated":"2025-09-04T20:02:52Z","snapshot_observed_at":"2026-08-07T10:58:14.958394Z","submitted_at":"2025-09-04T20:02:52Z","title":"Comparative Evaluation of Large Language Models for Test-Skeleton Generation","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-05T05:59:42.131373Z"},"links":{"citing_paper":"/paper/2509.04644"},"observation_digest":"sha256:500edd1d76da9ef53ae4a0665b7d761bc6a14bb2a7701d7facb4cb2f5f3feb43","observation_id":"3cdd46fe-230b-403c-81ec-48642f7b9676","resolution":{"observed_at":"2026-08-05T05:59:45.908762Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T05:59:45.897172Z","title":"This included appropriate usage of RSpec describe blocks and clear distinction between instance and class methods","venue":null,"work_id":"e198d9cd-a927-4282-87e1-6bd73c940035","year":null},"citing_paper":{"arxiv_id":"2509.04644","last_updated":"2025-09-04T20:02:52Z","snapshot_observed_at":"2026-08-07T10:58:14.958394Z","submitted_at":"2025-09-04T20:02:52Z","title":"Comparative Evaluation of Large Language Models for Test-Skeleton Generation","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-05T05:59:42.194904Z"},"links":{"citing_paper":"/paper/2509.04644"},"observation_digest":"sha256:78b2ddcb93a8014dac371038211c9aadf91211bfb0e8fd1332c21f872d8bde21","observation_id":"b85c90f0-a531-4c50-8718-a442114582a2","resolution":{"observed_at":"2026-08-05T05:59:45.900460Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T05:59:45.889073Z","title":"Its test skeleton was praised for its well -organized structure and strong alignment with RSpec idioms","venue":null,"work_id":"ecabced8-270a-477d-b549-dcd0615075cf","year":null},"citing_paper":{"arxiv_id":"2509.04644","last_updated":"2025-09-04T20:02:52Z","snapshot_observed_at":"2026-08-07T10:58:14.958394Z","submitted_at":"2025-09-04T20:02:52Z","title":"Comparative Evaluation of Large Language Models for Test-Skeleton Generation","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-05T05:59:42.268192Z"},"links":{"citing_paper":"/paper/2509.04644"},"observation_digest":"sha256:bfc3ffa97152371e2138a7600eedb8f31fde89b4aff535d9ca504e92f848c92a","observation_id":"0f6af92f-122c-406a-bab3-00aeff581380","resolution":{"observed_at":"2026-08-05T05:59:45.891842Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T05:59:45.881624Z","title":"Llama’s was the cleanest and easiest to maintain","venue":null,"work_id":"dc41abc4-5761-4571-b9d4-e400bf32cb51","year":null},"citing_paper":{"arxiv_id":"2509.04644","last_updated":"2025-09-04T20:02:52Z","snapshot_observed_at":"2026-08-07T10:58:14.958394Z","submitted_at":"2025-09-04T20:02:52Z","title":"Comparative Evaluation of Large Language Models for Test-Skeleton Generation","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-05T05:59:42.376257Z"},"links":{"citing_paper":"/paper/2509.04644"},"observation_digest":"sha256:9ba118e97f5c4cf817cf1cdd83e2fdede93f09e50f0d484121859818e8191060","observation_id":"98978fa1-f833-40e1-a54b-a47155aff6f8","resolution":{"observed_at":"2026-08-05T05:59:45.884101Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T05:59:45.874076Z","title":null,"venue":null,"work_id":"04693335-d7e7-4f40-850a-1c628daefdec","year":null},"citing_paper":{"arxiv_id":"2509.04644","last_updated":"2025-09-04T20:02:52Z","snapshot_observed_at":"2026-08-07T10:58:14.958394Z","submitted_at":"2025-09-04T20:02:52Z","title":"Comparative Evaluation of Large Language Models for Test-Skeleton Generation","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-05T05:59:42.510525Z"},"links":{"citing_paper":"/paper/2509.04644"},"observation_digest":"sha256:6cee42482364a0e2485883fda8373b3b7a2ab20d1f1821dab0fc6f7e4812a028","observation_id":"3f890ebc-a1d5-4762-b228-9b6fe29c5b27","resolution":{"observed_at":"2026-08-05T05:59:45.876794Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T05:59:45.866144Z","title":null,"venue":null,"work_id":"b6d51b2b-7a91-4b69-8035-3d52707a6bda","year":null},"citing_paper":{"arxiv_id":"2509.04644","last_updated":"2025-09-04T20:02:52Z","snapshot_observed_at":"2026-08-07T10:58:14.958394Z","submitted_at":"2025-09-04T20:02:52Z","title":"Comparative Evaluation of Large Language Models for Test-Skeleton Generation","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-05T05:59:42.605560Z"},"links":{"citing_paper":"/paper/2509.04644"},"observation_digest":"sha256:84e439f8a500558d60e83f11e28696b70452ad32ba2f8a2c356c23f0cda3833c","observation_id":"e4329897-e4db-4b47-9278-f75e5cae2c60","resolution":{"observed_at":"2026-08-05T05:59:45.869064Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T05:59:45.857932Z","title":"Models that produced clean, readable code, like Llama4, were deemed more suitable for collaborative workflows","venue":null,"work_id":"10653b14-0652-487d-b722-beef6e802624","year":null},"citing_paper":{"arxiv_id":"2509.04644","last_updated":"2025-09-04T20:02:52Z","snapshot_observed_at":"2026-08-07T10:58:14.958394Z","submitted_at":"2025-09-04T20:02:52Z","title":"Comparative Evaluation of Large Language Models for Test-Skeleton Generation","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-05T05:59:42.740858Z"},"links":{"citing_paper":"/paper/2509.04644"},"observation_digest":"sha256:84dd5fec9ad39aaec8ee95b42299785d02bc33aabe330d95d37475746e83256a","observation_id":"29b6aaa1-5873-40a0-91d1-64f80750467b","resolution":{"observed_at":"2026-08-05T05:59:45.860914Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T05:59:45.850355Z","title":null,"venue":null,"work_id":"63f92e93-2b65-4ab7-98e0-414c2bac352a","year":null},"citing_paper":{"arxiv_id":"2509.04644","last_updated":"2025-09-04T20:02:52Z","snapshot_observed_at":"2026-08-07T10:58:14.958394Z","submitted_at":"2025-09-04T20:02:52Z","title":"Comparative Evaluation of Large Language Models for Test-Skeleton Generation","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-05T05:59:42.846810Z"},"links":{"citing_paper":"/paper/2509.04644"},"observation_digest":"sha256:22e94bb908ef0b71ad4baf3f8419b8d2ba9bd852cf4534e792c9934927b3d9b3","observation_id":"e0e3f8a9-0755-4317-9ddf-74f8d609fb38","resolution":{"observed_at":"2026-08-05T05:59:45.852855Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T05:59:45.842220Z","title":null,"venue":null,"work_id":"742104e9-b9a1-433f-bb0f-5b2cf63e158e","year":null},"citing_paper":{"arxiv_id":"2509.04644","last_updated":"2025-09-04T20:02:52Z","snapshot_observed_at":"2026-08-07T10:58:14.958394Z","submitted_at":"2025-09-04T20:02:52Z","title":"Comparative Evaluation of Large Language Models for Test-Skeleton Generation","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-05T05:59:42.940550Z"},"links":{"citing_paper":"/paper/2509.04644"},"observation_digest":"sha256:7840c47f8b3c1dda1cb8177eb589dd8988dbb52677ee624b8447f263b51bf240","observation_id":"7a433ddd-0f37-47ab-bfae-26a6d7f05a1e","resolution":{"observed_at":"2026-08-05T05:59:45.845038Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T05:59:45.830503Z","title":null,"venue":null,"work_id":"42cf87dc-f89c-4148-a99e-4972c9aef660","year":null},"citing_paper":{"arxiv_id":"2509.04644","last_updated":"2025-09-04T20:02:52Z","snapshot_observed_at":"2026-08-07T10:58:14.958394Z","submitted_at":"2025-09-04T20:02:52Z","title":"Comparative Evaluation of Large Language Models for Test-Skeleton Generation","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-05T05:59:43.062723Z"},"links":{"citing_paper":"/paper/2509.04644"},"observation_digest":"sha256:f3b94c0ab7339d0bb86994984950c266253bf04d953a380606dc44aa4a9898fd","observation_id":"87812ec4-1834-44d7-8c1e-46d95612554a","resolution":{"observed_at":"2026-08-05T05:59:45.837008Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T05:59:45.742182Z","title":"While some models generated verbose skeletons with full coverage, these outputs were often dense, unstructured, or syntactically flawed","venue":null,"work_id":"2d7da849-ac79-4f63-965a-5705dc364cff","year":null},"citing_paper":{"arxiv_id":"2509.04644","last_updated":"2025-09-04T20:02:52Z","snapshot_observed_at":"2026-08-07T10:58:14.958394Z","submitted_at":"2025-09-04T20:02:52Z","title":"Comparative Evaluation of Large Language Models for Test-Skeleton Generation","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-05T05:59:43.203333Z"},"links":{"citing_paper":"/paper/2509.04644"},"observation_digest":"sha256:29d2b3e43b3d3d5ad562a1257fe8486fa036382d14b162a4fec508e9dabd3f0d","observation_id":"862e439c-4c30-465b-8671-195159d70a0c","resolution":{"observed_at":"2026-08-05T05:59:45.793706Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T05:59:45.593898Z","title":null,"venue":null,"work_id":"164d700a-d67a-41a8-a937-a28ed31ef8da","year":2024},"citing_paper":{"arxiv_id":"2509.04644","last_updated":"2025-09-04T20:02:52Z","snapshot_observed_at":"2026-08-07T10:58:14.958394Z","submitted_at":"2025-09-04T20:02:52Z","title":"Comparative Evaluation of Large Language Models for Test-Skeleton Generation","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-05T05:59:43.295770Z"},"links":{"citing_paper":"/paper/2509.04644"},"observation_digest":"sha256:9f5f4286a742da758ed796b36ab8410e4f5e04894e1755c91618470e11773ebd","observation_id":"142814e7-915c-4348-9883-7f7ede077fad","resolution":{"observed_at":"2026-08-05T05:59:45.673151Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T05:59:43.381587Z","title":"Automation of Test Skeletons Within Test-Driven Development Projects,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.04644","last_updated":"2025-09-04T20:02:52Z","snapshot_observed_at":"2026-08-07T10:58:14.958394Z","submitted_at":"2025-09-04T20:02:52Z","title":"Comparative Evaluation of Large Language Models for Test-Skeleton Generation","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-05T05:59:43.381587Z"},"links":{"citing_paper":"/paper/2509.04644"},"observation_digest":"sha256:a5da078fe0d8c31b54fcae75b65fcdcb54707d455e2e2077cbe93073a13f6e8d","observation_id":"88317820-8781-4781-877a-8906c4741ca8","resolution":{"observed_at":"2026-08-05T05:59:43.381587Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.07221","last_updated":"2024-03-04T07:58:11Z","snapshot_observed_at":"2026-07-31T20:29:18.011288Z","submitted_at":"2023-07-14T08:26:12Z","title":"Software Testing with Large Language Models: Survey, Landscape, and Vision","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.07221","snapshot_observed_at":"2026-08-05T05:59:43.507568Z","title":"Software Testing with Large Language Models: Survey, Landscape, and Vision","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.04644","last_updated":"2025-09-04T20:02:52Z","snapshot_observed_at":"2026-08-07T10:58:14.958394Z","submitted_at":"2025-09-04T20:02:52Z","title":"Comparative Evaluation of Large Language Models for Test-Skeleton Generation","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-05T05:59:43.507568Z"},"links":{"cited_paper":"/paper/2307.07221","citing_paper":"/paper/2509.04644"},"observation_digest":"sha256:7a508b81b3d7ded572daa0958172d440b49897d81986217ca489651ea94db763","observation_id":"c1ecfe73-34cb-4784-bcef-bebe459a42ed","resolution":{"observed_at":"2026-08-05T05:59:43.507568Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T05:59:45.447051Z","title":"Large Language Models for Software Engineering: A Systematic Literature Review","venue":null,"work_id":"e59b13f2-5336-411b-85b6-5a3e69897b47","year":2023},"citing_paper":{"arxiv_id":"2509.04644","last_updated":"2025-09-04T20:02:52Z","snapshot_observed_at":"2026-08-07T10:58:14.958394Z","submitted_at":"2025-09-04T20:02:52Z","title":"Comparative Evaluation of Large Language Models for Test-Skeleton Generation","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-05T05:59:43.653363Z"},"links":{"citing_paper":"/paper/2509.04644"},"observation_digest":"sha256:16685b37ef93ae2c5136e03b4b8002d9353cc405ecdb25240b4daf83b2f4698e","observation_id":"c57c1dd8-5430-40dc-aee1-fa33e674ced4","resolution":{"observed_at":"2026-08-05T05:59:45.512605Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T05:59:45.334238Z","title":"Intelligent Software Testing: Harnessing Machine Learning to Automate Test Case Generation and Defect Prediction","venue":null,"work_id":"9e80946b-7b41-44af-b087-b8d62026e815","year":2023},"citing_paper":{"arxiv_id":"2509.04644","last_updated":"2025-09-04T20:02:52Z","snapshot_observed_at":"2026-08-07T10:58:14.958394Z","submitted_at":"2025-09-04T20:02:52Z","title":"Comparative Evaluation of Large Language Models for Test-Skeleton Generation","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-05T05:59:43.741012Z"},"links":{"citing_paper":"/paper/2509.04644"},"observation_digest":"sha256:1019c9232e625a785808f662988813584da149c9760fef9bb56883ac3f88032d","observation_id":"6baeb417-25f0-4f31-bc11-249234aed318","resolution":{"observed_at":"2026-08-05T05:59:45.371492Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04531","last_updated":"2025-02-01T08:28:28Z","snapshot_observed_at":"2026-07-06T18:26:50.515452Z","submitted_at":"2024-06-06T22:07:50Z","title":"TESTEVAL: Benchmarking Large Language Models for Test Case Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.04531","snapshot_observed_at":"2026-08-05T05:59:43.828934Z","title":"R., & Ma, L","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.04644","last_updated":"2025-09-04T20:02:52Z","snapshot_observed_at":"2026-08-07T10:58:14.958394Z","submitted_at":"2025-09-04T20:02:52Z","title":"Comparative Evaluation of Large Language Models for Test-Skeleton Generation","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-05T05:59:43.828934Z"},"links":{"cited_paper":"/paper/2406.04531","citing_paper":"/paper/2509.04644"},"observation_digest":"sha256:c80b78d09da47925cfd01c43ed7d846ce1df70a9c899865662e92ae24d548b03","observation_id":"f1ef20a3-8da8-4d4d-8f12-4e68ed204cb4","resolution":{"observed_at":"2026-08-05T05:59:43.828934Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T05:59:45.175394Z","title":"Evaluating Large Language Models for Software Testing. Science of Computer Programming","venue":null,"work_id":"f58fcb53-666a-410a-b5a4-c680c2de1584","year":2025},"citing_paper":{"arxiv_id":"2509.04644","last_updated":"2025-09-04T20:02:52Z","snapshot_observed_at":"2026-08-07T10:58:14.958394Z","submitted_at":"2025-09-04T20:02:52Z","title":"Comparative Evaluation of Large Language Models for Test-Skeleton Generation","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-05T05:59:43.963435Z"},"links":{"citing_paper":"/paper/2509.04644"},"observation_digest":"sha256:e6c8aa7fa88e45d2693b4747790e3128b3a9296a3917b734d05ec11367b99f7d","observation_id":"9c1dff1c-6bb4-492c-94a6-4b25e24507f4","resolution":{"observed_at":"2026-08-05T05:59:45.264082Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T05:59:45.015476Z","title":"EvoSuite: Automatic Test Suite Generation for Object- Oriented Software","venue":null,"work_id":"1944a8e8-dd66-4a19-b235-34ff11dd094b","year":2011},"citing_paper":{"arxiv_id":"2509.04644","last_updated":"2025-09-04T20:02:52Z","snapshot_observed_at":"2026-08-07T10:58:14.958394Z","submitted_at":"2025-09-04T20:02:52Z","title":"Comparative Evaluation of Large Language Models for Test-Skeleton Generation","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-05T05:59:44.085058Z"},"links":{"citing_paper":"/paper/2509.04644"},"observation_digest":"sha256:402294a05e2a9a9ea07b88782718e3273c1e73b320fdb077ec04aa3de7b8a55a","observation_id":"b804f479-7dab-4b25-a69b-f7f736243ff1","resolution":{"observed_at":"2026-08-05T05:59:45.091153Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"1706.10817","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T05:59:44.751541Z","title":"CUTE: A Concolic Unit Testing Engine for C","venue":null,"work_id":"19c81768-fba9-4357-90d0-4fd88efa5f32","year":2005},"citing_paper":{"arxiv_id":"2509.04644","last_updated":"2025-09-04T20:02:52Z","snapshot_observed_at":"2026-08-07T10:58:14.958394Z","submitted_at":"2025-09-04T20:02:52Z","title":"Comparative Evaluation of Large Language Models for Test-Skeleton Generation","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-05T05:59:44.229379Z"},"links":{"citing_paper":"/paper/2509.04644"},"observation_digest":"sha256:1dc948cd5df18eacf53c17e2d2690ab35d7c1c58762e0f4aeeeafa6579d2362f","observation_id":"158ed5fb-e8d8-41a8-ac15-c6a5a0a0941b","resolution":{"observed_at":"2026-08-05T05:59:44.786201Z","resolver_source":"raw_fallback","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1109/icse.2015.26","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T05:59:44.411880Z","title":"Improving Automated Test Case Generation with Learning-to-Rank Techniques","venue":null,"work_id":"2bc98a0a-d343-4274-86c1-93171e931e19","year":2015},"citing_paper":{"arxiv_id":"2509.04644","last_updated":"2025-09-04T20:02:52Z","snapshot_observed_at":"2026-08-07T10:58:14.958394Z","submitted_at":"2025-09-04T20:02:52Z","title":"Comparative Evaluation of Large Language Models for Test-Skeleton Generation","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-05T05:59:44.294754Z"},"links":{"citing_paper":"/paper/2509.04644"},"observation_digest":"sha256:f37325fd328307e83b9f46ff4fffdb1f2be7a0ba02323894204e8f8e8c22bea0","observation_id":"780e796e-02ff-4c64-8b1d-df185da2c10d","resolution":{"observed_at":"2026-08-05T05:59:44.462803Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.11321","last_updated":"2023-06-20T06:37:28Z","snapshot_observed_at":"2026-07-06T15:44:27.766505Z","submitted_at":"2023-06-20T06:37:28Z","title":"Intrinsic Nonlinear Hall Detection of the N\\'eel Vector for Two-Dimensional Antiferromagnetic Spintronics","version":1},"cited_work":{"arxiv_id":"2306.11321","doi":null,"metadata_source":"pith","pith_arxiv_id":"2306.11321","snapshot_observed_at":"2026-08-05T05:59:44.537412Z","title":"Intrinsic Nonlinear Hall Detection of the N\\'eel Vector for Two-Dimensional Antiferromagnetic Spintronics","venue":"cond-mat.mtrl-sci","work_id":"e52e5bc2-f6df-4cdf-858f-04e1207fd9d8","year":2023},"citing_paper":{"arxiv_id":"2509.04644","last_updated":"2025-09-04T20:02:52Z","snapshot_observed_at":"2026-08-07T10:58:14.958394Z","submitted_at":"2025-09-04T20:02:52Z","title":"Comparative Evaluation of Large Language Models for Test-Skeleton Generation","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-05T05:59:44.334749Z"},"links":{"cited_paper":"/paper/2306.11321","citing_paper":"/paper/2509.04644"},"observation_digest":"sha256:ec342d57394901e7d670dbd6098defd7dbbb50fad5d5f91adb4c599f178657f9","observation_id":"57918f8e-d878-48fc-9b2d-54d82ff63d7b","resolution":{"observed_at":"2026-08-05T05:59:44.620488Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T05:59:44.163389Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.04644","last_updated":"2025-09-04T20:02:52Z","snapshot_observed_at":"2026-08-07T10:58:14.958394Z","submitted_at":"2025-09-04T20:02:52Z","title":"Comparative Evaluation of Large Language Models for Test-Skeleton Generation","version":1},"reference_index":419,"source":"pdf_text","source_observed_at":"2026-08-05T05:59:44.163389Z"},"links":{"citing_paper":"/paper/2509.04644"},"observation_digest":"sha256:a4e6d3f6f00a0fcede06b1f0c7b36806541863fdb06a051910f7ad83a1dad897","observation_id":"eec26237-07d0-495b-a655-4b8974e6c9ba","resolution":{"observed_at":"2026-08-05T05:59:44.163389Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2509.04644","last_updated":"2025-09-04T20:02:52Z","latest_version":1,"primary_category":"cs.SE","snapshot_observed_at":"2026-08-07T10:58:14.958394Z","submitted_at":"2025-09-04T20:02:52Z","title":"Comparative Evaluation of Large Language Models for Test-Skeleton Generation"},"reference_resolution":{"displayed":32,"state_counts":{"malformed_identifier":0,"metadata_mismatch":2,"parse_uncertain":0,"unresolved":16,"verified_exact":1,"verified_fuzzy":13},"total_outbound_references":32},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 32 of 32 outbound references and 0 inbound Pith citation observations for arXiv:2509.04644."}