{"as_of":"2026-08-09T17:01:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:0f9cea2b4cba57257d7470129157848504a78b58717a25a93336da9cbb245bdd","coverage":[{"denominator":24,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":24,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T17:14:07.903751Z","state":"measured"},{"denominator":24,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":24,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2608.03535/citation-record","integrity":"/paper/2608.03535/integrity","json":"/paper/2608.03535/citation-record.json","paper":"/paper/2608.03535"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:14:08.516846Z","title":null,"venue":null,"work_id":"69eb258b-dc4b-4dc9-8124-63cb37355217","year":2026},"citing_paper":{"arxiv_id":"2608.03535","last_updated":"2026-08-04T12:15:17Z","snapshot_observed_at":"2026-08-07T23:12:03.807732Z","submitted_at":"2026-08-04T12:15:17Z","title":"CodeAssay: A Multi-Metric Benchmark with Audited Ground Truth for LLM Code Generation","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-05T17:14:07.764068Z"},"links":{"citing_paper":"/paper/2608.03535"},"observation_digest":"sha256:c256fbfa8bff929bf5ef4440b6b1d390e0a3ae8f5e3d0e791c0cdfae3ad45d19","observation_id":"e60e575f-6a50-4e9f-8633-511db4d4739a","resolution":{"observed_at":"2026-08-05T17:14:08.524030Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2108.07732","last_updated":"2021-08-16T03:57:30Z","snapshot_observed_at":"2026-08-02T19:23:53.535075Z","submitted_at":"2021-08-16T03:57:30Z","title":"Program Synthesis with Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2108.07732","snapshot_observed_at":"2026-08-05T17:14:07.770257Z","title":"arXiv preprint arXiv:2108.07732 (2021)","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.03535","last_updated":"2026-08-04T12:15:17Z","snapshot_observed_at":"2026-08-07T23:12:03.807732Z","submitted_at":"2026-08-04T12:15:17Z","title":"CodeAssay: A Multi-Metric Benchmark with Audited Ground Truth for LLM Code Generation","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-05T17:14:07.770257Z"},"links":{"cited_paper":"/paper/2108.07732","citing_paper":"/paper/2608.03535"},"observation_digest":"sha256:17e2c08515436c21bcf983a20948aac20fc47cbd307ea2526834053a401f06a3","observation_id":"e8d4b94b-8de9-4d36-bd13-6be6ac86377b","resolution":{"observed_at":"2026-08-05T17:14:07.770257Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:14:08.497943Z","title":"In: 2025 IEEE/ACM 2nd International Conference on AI Foundation Models and Software Engineering (FORGE)","venue":null,"work_id":"57420fc8-5418-40d2-9143-d9a645d0e99a","year":2025},"citing_paper":{"arxiv_id":"2608.03535","last_updated":"2026-08-04T12:15:17Z","snapshot_observed_at":"2026-08-07T23:12:03.807732Z","submitted_at":"2026-08-04T12:15:17Z","title":"CodeAssay: A Multi-Metric Benchmark with Audited Ground Truth for LLM Code Generation","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-05T17:14:07.777616Z"},"links":{"citing_paper":"/paper/2608.03535"},"observation_digest":"sha256:4d571c7e4ed3a14c02112094235050b37cfee3c42183e4b2a815a5bf2f1b5712","observation_id":"bf20932a-f147-4de8-a8d3-df22327356f9","resolution":{"observed_at":"2026-08-05T17:14:08.503473Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2107.03374","last_updated":"2021-07-14T17:16:02Z","snapshot_observed_at":"2026-08-08T11:58:24.516369Z","submitted_at":"2021-07-07T17:41:24Z","title":"Evaluating Large Language Models Trained on Code","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2107.03374","snapshot_observed_at":"2026-08-05T17:14:07.784348Z","title":"arXiv preprint arXiv:2107.03374 (2021)","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.03535","last_updated":"2026-08-04T12:15:17Z","snapshot_observed_at":"2026-08-07T23:12:03.807732Z","submitted_at":"2026-08-04T12:15:17Z","title":"CodeAssay: A Multi-Metric Benchmark with Audited Ground Truth for LLM Code Generation","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-05T17:14:07.784348Z"},"links":{"cited_paper":"/paper/2107.03374","citing_paper":"/paper/2608.03535"},"observation_digest":"sha256:447b86d87cba42eec0b395330431f9c8d834669961596a378b159e8198e083d2","observation_id":"bdcdd895-b877-4576-9b94-841e85899d12","resolution":{"observed_at":"2026-08-05T17:14:07.784348Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:14:08.477623Z","title":"Biometrika 37(3–4), 256–266 (1950) 16 S","venue":null,"work_id":"47f34a7b-7507-4bb2-9da9-a7167ca6238c","year":1950},"citing_paper":{"arxiv_id":"2608.03535","last_updated":"2026-08-04T12:15:17Z","snapshot_observed_at":"2026-08-07T23:12:03.807732Z","submitted_at":"2026-08-04T12:15:17Z","title":"CodeAssay: A Multi-Metric Benchmark with Audited Ground Truth for LLM Code Generation","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-05T17:14:07.789495Z"},"links":{"citing_paper":"/paper/2608.03535"},"observation_digest":"sha256:a0cad57ab73d96997c2adf886d1db6dfca8bcdb742fddfd55411941a7e04462e","observation_id":"b59d397d-8b35-4cae-a7f3-24a381b4da9c","resolution":{"observed_at":"2026-08-05T17:14:08.483421Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:14:08.458336Z","title":"In: Proc","venue":null,"work_id":"ccfec3e8-cba9-44e9-8f01-2f36417a628a","year":2024},"citing_paper":{"arxiv_id":"2608.03535","last_updated":"2026-08-04T12:15:17Z","snapshot_observed_at":"2026-08-07T23:12:03.807732Z","submitted_at":"2026-08-04T12:15:17Z","title":"CodeAssay: A Multi-Metric Benchmark with Audited Ground Truth for LLM Code Generation","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-05T17:14:07.795382Z"},"links":{"citing_paper":"/paper/2608.03535"},"observation_digest":"sha256:2aff188ce91dfad85380a84855d354fb2dbdd9b90d128857ec45fe78f1fc5283","observation_id":"eeeb9676-1bd7-4eb4-83d2-21f2941a02bd","resolution":{"observed_at":"2026-08-05T17:14:08.465692Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:14:08.437829Z","title":"ACM Transactions on Software Engineering and Methodology33(8), 1–79 (2024)","venue":null,"work_id":"9cc420c2-624a-4bce-b8fb-7d670e6b44db","year":2024},"citing_paper":{"arxiv_id":"2608.03535","last_updated":"2026-08-04T12:15:17Z","snapshot_observed_at":"2026-08-07T23:12:03.807732Z","submitted_at":"2026-08-04T12:15:17Z","title":"CodeAssay: A Multi-Metric Benchmark with Audited Ground Truth for LLM Code Generation","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-05T17:14:07.802879Z"},"links":{"citing_paper":"/paper/2608.03535"},"observation_digest":"sha256:71175f08f0969ae28532a18ae57e2fe8e6028927db22a43d2bc4b4e663411f33","observation_id":"5580e694-9e1e-4a92-a9db-9194b0dba413","resolution":{"observed_at":"2026-08-05T17:14:08.444260Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:14:08.414739Z","title":null,"venue":null,"work_id":"e0d8c46b-1544-42f9-afdf-1624d814a631","year":2024},"citing_paper":{"arxiv_id":"2608.03535","last_updated":"2026-08-04T12:15:17Z","snapshot_observed_at":"2026-08-07T23:12:03.807732Z","submitted_at":"2026-08-04T12:15:17Z","title":"CodeAssay: A Multi-Metric Benchmark with Audited Ground Truth for LLM Code Generation","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-05T17:14:07.808051Z"},"links":{"citing_paper":"/paper/2608.03535"},"observation_digest":"sha256:55a5290a248202f792dfe5fa4e688abc27d080c9f01c99d0f5b7c7c65b93d236","observation_id":"412fb120-6a9e-4fa2-ae8a-096aee8d52d4","resolution":{"observed_at":"2026-08-05T17:14:08.420614Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:14:08.387920Z","title":"In: Proc","venue":null,"work_id":"38db39e6-e8e7-42b4-9827-b07a3cc6985c","year":2014},"citing_paper":{"arxiv_id":"2608.03535","last_updated":"2026-08-04T12:15:17Z","snapshot_observed_at":"2026-08-07T23:12:03.807732Z","submitted_at":"2026-08-04T12:15:17Z","title":"CodeAssay: A Multi-Metric Benchmark with Audited Ground Truth for LLM Code Generation","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-05T17:14:07.814037Z"},"links":{"citing_paper":"/paper/2608.03535"},"observation_digest":"sha256:f22876825dbf2a7368d27f2182e88b44c7d08ab1ba2b54f8f4ce3b5dbd84aff7","observation_id":"92093728-3b9b-4590-b160-603be860f058","resolution":{"observed_at":"2026-08-05T17:14:08.394550Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:14:08.367397Z","title":"In: International Conference on Learning Representations (2025)","venue":null,"work_id":"c209a9a4-65ac-408c-862a-f2b89f7ed5fb","year":2025},"citing_paper":{"arxiv_id":"2608.03535","last_updated":"2026-08-04T12:15:17Z","snapshot_observed_at":"2026-08-07T23:12:03.807732Z","submitted_at":"2026-08-04T12:15:17Z","title":"CodeAssay: A Multi-Metric Benchmark with Audited Ground Truth for LLM Code Generation","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-05T17:14:07.818825Z"},"links":{"citing_paper":"/paper/2608.03535"},"observation_digest":"sha256:df41516680fb641ac24cd0497841f4d64af90adf30ae014fa1e7934c88380a58","observation_id":"84fc1ddb-41c5-459c-8a75-f691c86db7ab","resolution":{"observed_at":"2026-08-05T17:14:08.373805Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:14:08.348637Z","title":"22nd ACM SIG- SOFT International Symposium on Foundations of Software Engineering (FSE)","venue":null,"work_id":"95967876-e9b6-4211-a71a-e7e6b423ebd6","year":2014},"citing_paper":{"arxiv_id":"2608.03535","last_updated":"2026-08-04T12:15:17Z","snapshot_observed_at":"2026-08-07T23:12:03.807732Z","submitted_at":"2026-08-04T12:15:17Z","title":"CodeAssay: A Multi-Metric Benchmark with Audited Ground Truth for LLM Code Generation","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-05T17:14:07.824173Z"},"links":{"citing_paper":"/paper/2608.03535"},"observation_digest":"sha256:f6497d133295953e32faee61931d281db60866ceeefa03345cf3b0df1b5c2f77","observation_id":"df03c12b-456f-436c-b5f1-17cd4322e26c","resolution":{"observed_at":"2026-08-05T17:14:08.354892Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:14:08.328801Z","title":"In: Advances in Neural Information Processing Systems (NeurIPS)","venue":null,"work_id":"1f2b51f2-a980-4158-894a-370c9081bb64","year":2023},"citing_paper":{"arxiv_id":"2608.03535","last_updated":"2026-08-04T12:15:17Z","snapshot_observed_at":"2026-08-07T23:12:03.807732Z","submitted_at":"2026-08-04T12:15:17Z","title":"CodeAssay: A Multi-Metric Benchmark with Audited Ground Truth for LLM Code Generation","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-05T17:14:07.829552Z"},"links":{"citing_paper":"/paper/2608.03535"},"observation_digest":"sha256:a9a029bf9bdf66652bbb9f2dc8a8afc90310654feb993d7e018fde67e2ad965c","observation_id":"89838c90-80b1-44a6-af73-97c29c575060","resolution":{"observed_at":"2026-08-05T17:14:08.335032Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:14:08.309791Z","title":"IEEE Transactions on Software Engineering SE-2(4), 308–320 (1976)","venue":null,"work_id":"bddd29e1-1b0f-4646-baa0-036faf161e17","year":1976},"citing_paper":{"arxiv_id":"2608.03535","last_updated":"2026-08-04T12:15:17Z","snapshot_observed_at":"2026-08-07T23:12:03.807732Z","submitted_at":"2026-08-04T12:15:17Z","title":"CodeAssay: A Multi-Metric Benchmark with Audited Ground Truth for LLM Code Generation","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-05T17:14:07.836359Z"},"links":{"citing_paper":"/paper/2608.03535"},"observation_digest":"sha256:feaa5cbe2caa92d0c99b8d14e4bc8d027b462efa6277223eb1bb81aa6bfc0451","observation_id":"eccda045-25e9-4bda-a555-bbfcee294331","resolution":{"observed_at":"2026-08-05T17:14:08.315390Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:14:08.290147Z","title":"In: Proc","venue":null,"work_id":"c89bfc29-5965-4463-b185-575718c5ef3a","year":2022},"citing_paper":{"arxiv_id":"2608.03535","last_updated":"2026-08-04T12:15:17Z","snapshot_observed_at":"2026-08-07T23:12:03.807732Z","submitted_at":"2026-08-04T12:15:17Z","title":"CodeAssay: A Multi-Metric Benchmark with Audited Ground Truth for LLM Code Generation","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-05T17:14:07.842126Z"},"links":{"citing_paper":"/paper/2608.03535"},"observation_digest":"sha256:58cb0b8f54819d036b8be7566be4ac20d74beb9ce4907b25e577ff3a85a5de4e","observation_id":"bf1b5c0f-1889-41da-8eb2-a179aa20fb61","resolution":{"observed_at":"2026-08-05T17:14:08.295485Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:14:08.269685Z","title":"2023 ACM SIGSAC Conference on Computer and Communications Security (CCS)","venue":null,"work_id":"aeffeb1b-e837-446b-bf97-5d964e472d7c","year":2023},"citing_paper":{"arxiv_id":"2608.03535","last_updated":"2026-08-04T12:15:17Z","snapshot_observed_at":"2026-08-07T23:12:03.807732Z","submitted_at":"2026-08-04T12:15:17Z","title":"CodeAssay: A Multi-Metric Benchmark with Audited Ground Truth for LLM Code Generation","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-05T17:14:07.848107Z"},"links":{"citing_paper":"/paper/2608.03535"},"observation_digest":"sha256:77b1c4a4a087b54d63ccd280e8f708dedb47b3805c20d3f33eb090059ccf5559","observation_id":"a0f0014f-a1ba-4413-9fe4-d5ca283cde09","resolution":{"observed_at":"2026-08-05T17:14:08.277024Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:14:08.248909Z","title":"In: Proc","venue":null,"work_id":"7cbf04b8-4b97-4aa8-b4e4-8295a75d1cb9","year":2024},"citing_paper":{"arxiv_id":"2608.03535","last_updated":"2026-08-04T12:15:17Z","snapshot_observed_at":"2026-08-07T23:12:03.807732Z","submitted_at":"2026-08-04T12:15:17Z","title":"CodeAssay: A Multi-Metric Benchmark with Audited Ground Truth for LLM Code Generation","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-05T17:14:07.853458Z"},"links":{"citing_paper":"/paper/2608.03535"},"observation_digest":"sha256:48ff21e1c241b4aa601d79cf26c51f6a6726d0c89f41a734da0ec8347f14c7b1","observation_id":"c0661c0d-2b1d-47a8-a76e-a17b8f4c1a13","resolution":{"observed_at":"2026-08-05T17:14:08.254740Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:14:08.226646Z","title":"In: Proc","venue":null,"work_id":"d862e821-4db7-434a-86c0-71443b0e1511","year":2022},"citing_paper":{"arxiv_id":"2608.03535","last_updated":"2026-08-04T12:15:17Z","snapshot_observed_at":"2026-08-07T23:12:03.807732Z","submitted_at":"2026-08-04T12:15:17Z","title":"CodeAssay: A Multi-Metric Benchmark with Audited Ground Truth for LLM Code Generation","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-05T17:14:07.859967Z"},"links":{"citing_paper":"/paper/2608.03535"},"observation_digest":"sha256:20661607af985219c4660656ed171ab7f26c5ad5f8b4ecd2013316be1cc840d6","observation_id":"c80ca32c-6b47-4134-ba4d-6c8a9fe13f1b","resolution":{"observed_at":"2026-08-05T17:14:08.233705Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:14:08.193860Z","title":"Journal of Systems and Software238, 112885 (2026)","venue":null,"work_id":"d5f27dc8-ce49-47e1-8551-db0f7f9a8163","year":2026},"citing_paper":{"arxiv_id":"2608.03535","last_updated":"2026-08-04T12:15:17Z","snapshot_observed_at":"2026-08-07T23:12:03.807732Z","submitted_at":"2026-08-04T12:15:17Z","title":"CodeAssay: A Multi-Metric Benchmark with Audited Ground Truth for LLM Code Generation","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-05T17:14:07.864842Z"},"links":{"citing_paper":"/paper/2608.03535"},"observation_digest":"sha256:ef6e92e48a81f0c63315bb309b926b41e0fe9ca293b896ab8255b7fd7d69f9f9","observation_id":"3e177fa8-0e34-4a29-8099-2cdcdd0221b4","resolution":{"observed_at":"2026-08-05T17:14:08.200963Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:14:08.166685Z","title":"42nd International Conference on Machine Learning (ICML)","venue":null,"work_id":"f2dc1191-b138-4913-bfa1-4420e59581a6","year":2025},"citing_paper":{"arxiv_id":"2608.03535","last_updated":"2026-08-04T12:15:17Z","snapshot_observed_at":"2026-08-07T23:12:03.807732Z","submitted_at":"2026-08-04T12:15:17Z","title":"CodeAssay: A Multi-Metric Benchmark with Audited Ground Truth for LLM Code Generation","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-05T17:14:07.871665Z"},"links":{"citing_paper":"/paper/2608.03535"},"observation_digest":"sha256:e5f0dd6894cc33676d704c338c6d077053ce7daad4f1d5d3f6b598b8529cad7d","observation_id":"f87d8bf3-ab62-4d9c-9c2a-e34075057b11","resolution":{"observed_at":"2026-08-05T17:14:08.173527Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:14:08.137604Z","title":"Biometrics Bulletin 1(6), 80–83 (1945) CodeAssay: A Multi-Metric, Audited Code-Generation Benchmark 17","venue":null,"work_id":"599c7351-3648-4a33-8709-2e62f1f9df14","year":1945},"citing_paper":{"arxiv_id":"2608.03535","last_updated":"2026-08-04T12:15:17Z","snapshot_observed_at":"2026-08-07T23:12:03.807732Z","submitted_at":"2026-08-04T12:15:17Z","title":"CodeAssay: A Multi-Metric Benchmark with Audited Ground Truth for LLM Code Generation","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-05T17:14:07.877864Z"},"links":{"citing_paper":"/paper/2608.03535"},"observation_digest":"sha256:5bb2a8cd9415c26e165408e470e894e7b8cc9ca3360bf24e3b15716881ad4030","observation_id":"875e65b5-4d53-40ea-8719-1ede67dc42bc","resolution":{"observed_at":"2026-08-05T17:14:08.147453Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:14:08.114561Z","title":"In: Proc","venue":null,"work_id":"73f5e323-18ee-4864-b057-a63f82cb58e9","year":2026},"citing_paper":{"arxiv_id":"2608.03535","last_updated":"2026-08-04T12:15:17Z","snapshot_observed_at":"2026-08-07T23:12:03.807732Z","submitted_at":"2026-08-04T12:15:17Z","title":"CodeAssay: A Multi-Metric Benchmark with Audited Ground Truth for LLM Code Generation","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-05T17:14:07.885821Z"},"links":{"citing_paper":"/paper/2608.03535"},"observation_digest":"sha256:43dd5823f8f65c993d49ba1842646a9273ad567238dfd9c38ee523d534978318","observation_id":"1ed260ee-cfd6-45ff-8950-ddff883836e9","resolution":{"observed_at":"2026-08-05T17:14:08.120690Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:14:08.080995Z","title":"In: Proc","venue":null,"work_id":"79b6fc48-6d63-4279-ab88-4b9cf40fa74e","year":2024},"citing_paper":{"arxiv_id":"2608.03535","last_updated":"2026-08-04T12:15:17Z","snapshot_observed_at":"2026-08-07T23:12:03.807732Z","submitted_at":"2026-08-04T12:15:17Z","title":"CodeAssay: A Multi-Metric Benchmark with Audited Ground Truth for LLM Code Generation","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-05T17:14:07.891766Z"},"links":{"citing_paper":"/paper/2608.03535"},"observation_digest":"sha256:949fc73529724a0152b678d1b7f8c3ee26a0b6134d30c5b87b81d7c40ce78c9a","observation_id":"71167ad2-66e9-4311-b64a-fc622995aa8e","resolution":{"observed_at":"2026-08-05T17:14:08.095562Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.11470","last_updated":"2024-10-09T05:59:07Z","snapshot_observed_at":"2026-07-06T18:47:00.524107Z","submitted_at":"2024-07-16T08:08:48Z","title":"Beyond Correctness: Benchmarking Multi-dimensional Code Generation for Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.11470","snapshot_observed_at":"2026-08-05T17:14:07.898036Z","title":"arXiv preprint arXiv:2407.11470 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.03535","last_updated":"2026-08-04T12:15:17Z","snapshot_observed_at":"2026-08-07T23:12:03.807732Z","submitted_at":"2026-08-04T12:15:17Z","title":"CodeAssay: A Multi-Metric Benchmark with Audited Ground Truth for LLM Code Generation","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-05T17:14:07.898036Z"},"links":{"cited_paper":"/paper/2407.11470","citing_paper":"/paper/2608.03535"},"observation_digest":"sha256:2652b495dbb9417229377b66272df44aeffefa30e143e3e31497985e054574a2","observation_id":"de004fe9-a825-4661-90da-7af60fb827bf","resolution":{"observed_at":"2026-08-05T17:14:07.898036Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:14:08.051265Z","title":"In: Proc","venue":null,"work_id":"2842d51c-00ce-4b5c-8187-c2a26761463e","year":2025},"citing_paper":{"arxiv_id":"2608.03535","last_updated":"2026-08-04T12:15:17Z","snapshot_observed_at":"2026-08-07T23:12:03.807732Z","submitted_at":"2026-08-04T12:15:17Z","title":"CodeAssay: A Multi-Metric Benchmark with Audited Ground Truth for LLM Code Generation","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-05T17:14:07.903751Z"},"links":{"citing_paper":"/paper/2608.03535"},"observation_digest":"sha256:bedd6378f6a7541bddc94100be9947e9215a395eca6d69a0a969230a252cbb8c","observation_id":"f622dab2-246a-4223-a682-952f770d8a7e","resolution":{"observed_at":"2026-08-05T17:14:08.060964Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2608.03535","last_updated":"2026-08-04T12:15:17Z","latest_version":1,"primary_category":"cs.SE","snapshot_observed_at":"2026-08-07T23:12:03.807732Z","submitted_at":"2026-08-04T12:15:17Z","title":"CodeAssay: A Multi-Metric Benchmark with Audited Ground Truth for LLM Code Generation"},"reference_resolution":{"displayed":24,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":5,"verified_exact":0,"verified_fuzzy":19},"total_outbound_references":24},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 24 of 24 outbound references and 0 inbound Pith citation observations for arXiv:2608.03535."}