{"as_of":"2026-08-10T05:01:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:5cc60e6551c44800db38c7e19a1207c0bbe3188bb0ab73982580389088cbd3d9","coverage":[{"denominator":39,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":39,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T10:22:13.453350Z","state":"measured"},{"denominator":53,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":53,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":14,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":14,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T10:17:26.769794Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T04:09:34.777136Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.05692","last_updated":"2025-06-20T12:42:57Z","snapshot_observed_at":"2026-08-09T09:46:21.168984Z","submitted_at":"2025-06-06T02:48:02Z","title":"SafeGenBench: A Benchmark Framework for Security Vulnerability Detection in LLM-Generated Code","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.05692","snapshot_observed_at":"2026-08-07T10:17:26.769794Z","title":"Safegenbench: A benchmark framework for security vulnerability detection in llm-generated code,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.11094","last_updated":"2025-10-30T06:22:33Z","snapshot_observed_at":"2026-08-07T10:11:06.747781Z","submitted_at":"2025-06-06T05:50:50Z","title":"The Scales of Justitia: A Comprehensive Survey on Safety Evaluation of LLMs","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-07T10:17:26.769794Z"},"links":{"cited_paper":"/paper/2506.05692","citing_paper":"/paper/2506.11094"},"observation_digest":"sha256:2bb8a0b16aabfca0b4a7f7c6eff3340287d113567723b6e583cba66a9cb650a3","observation_id":"61f9837f-bff1-4280-b78e-f6453c9785b0","resolution":{"observed_at":"2026-08-07T10:17:26.769794Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.05692","last_updated":"2025-06-20T12:42:57Z","snapshot_observed_at":"2026-08-09T09:46:21.168984Z","submitted_at":"2025-06-06T02:48:02Z","title":"SafeGenBench: A Benchmark Framework for Security Vulnerability Detection in LLM-Generated Code","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.05692","snapshot_observed_at":"2026-08-03T05:18:43.734775Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.04894","last_updated":"2026-06-05T16:30:46Z","snapshot_observed_at":"2026-08-06T23:30:53.886306Z","submitted_at":"2026-02-02T22:23:36Z","title":"Extracting Recurring Vulnerabilities from Black-Box LLM-Generated Software","version":4},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-03T05:18:43.734775Z"},"links":{"cited_paper":"/paper/2506.05692","citing_paper":"/paper/2602.04894"},"observation_digest":"sha256:43706319ddcb943129e0157f4c822426f7bb625d94fcf773a4110a1cbe8648d8","observation_id":"bd32eeba-1950-480b-aa1a-c8119ef59ad0","resolution":{"observed_at":"2026-08-03T05:18:43.734775Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.05692","last_updated":"2025-06-20T12:42:57Z","snapshot_observed_at":"2026-08-09T09:46:21.168984Z","submitted_at":"2025-06-06T02:48:02Z","title":"SafeGenBench: A Benchmark Framework for Security Vulnerability Detection in LLM-Generated Code","version":3},"cited_work":{"arxiv_id":"2506.05692","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.05692","snapshot_observed_at":"2026-07-04T04:09:34.777136Z","title":"2025.URL:https://arxiv.org/abs/2506.05692","venue":null,"work_id":"7050a891-6f49-4d25-a618-a355df93e887","year":2025},"citing_paper":{"arxiv_id":"2604.17014","last_updated":"2026-04-21T15:54:52Z","snapshot_observed_at":"2026-08-05T04:24:23.924168Z","submitted_at":"2026-04-18T14:52:26Z","title":"False Security Confidence in Benign LLM Code Generation","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-10T06:20:52.774912Z"},"links":{"cited_paper":"/paper/2506.05692","citing_paper":"/paper/2604.17014"},"observation_digest":"sha256:bae5f297501c6239a1f84f86c24e8afd4434920d29cf38ea440f2c1143521cb1","observation_id":"80fe48cd-4c88-4d9f-b7c7-86f8fcf6fa8e","resolution":{"observed_at":"2026-05-10T06:21:26.746518Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.05692","last_updated":"2025-06-20T12:42:57Z","snapshot_observed_at":"2026-08-09T09:46:21.168984Z","submitted_at":"2025-06-06T02:48:02Z","title":"SafeGenBench: A Benchmark Framework for Security Vulnerability Detection in LLM-Generated Code","version":3},"cited_work":{"arxiv_id":"2506.05692","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.05692","snapshot_observed_at":"2026-07-04T04:09:34.777136Z","title":"2025.URL:https://arxiv.org/abs/2506.05692","venue":null,"work_id":"7050a891-6f49-4d25-a618-a355df93e887","year":2025},"citing_paper":{"arxiv_id":"2604.20179","last_updated":"2026-04-22T04:50:48Z","snapshot_observed_at":"2026-08-05T12:23:29.421477Z","submitted_at":"2026-04-22T04:50:48Z","title":"Taint-Style Vulnerability Detection and Confirmation for Node.js Packages Using LLM Agent Reasoning","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-10T00:56:42.767929Z"},"links":{"cited_paper":"/paper/2506.05692","citing_paper":"/paper/2604.20179"},"observation_digest":"sha256:d3426b26a1a8c68a26f2ed5a6f72f8c4b293608024ef3beda0596e940c5c0c71","observation_id":"90c05cd9-b579-4d74-b9d7-94e4ee5fbf69","resolution":{"observed_at":"2026-05-10T00:59:49.633068Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.05692","last_updated":"2025-06-20T12:42:57Z","snapshot_observed_at":"2026-08-09T09:46:21.168984Z","submitted_at":"2025-06-06T02:48:02Z","title":"SafeGenBench: A Benchmark Framework for Security Vulnerability Detection in LLM-Generated Code","version":3},"cited_work":{"arxiv_id":"2506.05692","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.05692","snapshot_observed_at":"2026-07-04T04:09:34.777136Z","title":"2025.URL:https://arxiv.org/abs/2506.05692","venue":null,"work_id":"7050a891-6f49-4d25-a618-a355df93e887","year":2025},"citing_paper":{"arxiv_id":"2605.05867","last_updated":"2026-05-07T08:34:00Z","snapshot_observed_at":"2026-07-06T23:18:26.864785Z","submitted_at":"2026-05-07T08:34:00Z","title":"On Fixing Insecure AI-Generated Code through Model Fine-Tuning and Prompting Strategies","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-08T09:12:15.486780Z"},"links":{"cited_paper":"/paper/2506.05692","citing_paper":"/paper/2605.05867"},"observation_digest":"sha256:2f679024fb049dd4e88baa8d02cd5126ed1d4fda1a34c1c64f5f5c6cccfc570d","observation_id":"547f6267-2fff-48c6-a572-25ea7a88cb65","resolution":{"observed_at":"2026-05-11T20:26:09.981257Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.05692","last_updated":"2025-06-20T12:42:57Z","snapshot_observed_at":"2026-08-09T09:46:21.168984Z","submitted_at":"2025-06-06T02:48:02Z","title":"SafeGenBench: A Benchmark Framework for Security Vulnerability Detection in LLM-Generated Code","version":3},"cited_work":{"arxiv_id":"2506.05692","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.05692","snapshot_observed_at":"2026-07-04T04:09:34.777136Z","title":"2025.URL:https://arxiv.org/abs/2506.05692","venue":null,"work_id":"7050a891-6f49-4d25-a618-a355df93e887","year":2025},"citing_paper":{"arxiv_id":"2605.12746","last_updated":"2026-05-12T20:49:30Z","snapshot_observed_at":"2026-07-06T23:24:23.402304Z","submitted_at":"2026-05-12T20:49:30Z","title":"CoT-Guard: Small Models for Strong Monitoring","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-14T19:39:16.264272Z"},"links":{"cited_paper":"/paper/2506.05692","citing_paper":"/paper/2605.12746"},"observation_digest":"sha256:e0dcc8077064ed276c9e6e71b0cae279a9981cdfc53e01d4bfed28acd2561a24","observation_id":"a3915f51-e380-45ed-95b0-7fae6f255723","resolution":{"observed_at":"2026-05-14T19:39:23.772865Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.05692","last_updated":"2025-06-20T12:42:57Z","snapshot_observed_at":"2026-08-09T09:46:21.168984Z","submitted_at":"2025-06-06T02:48:02Z","title":"SafeGenBench: A Benchmark Framework for Security Vulnerability Detection in LLM-Generated Code","version":3},"cited_work":{"arxiv_id":"2506.05692","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.05692","snapshot_observed_at":"2026-07-04T04:09:34.777136Z","title":"2025.URL:https://arxiv.org/abs/2506.05692","venue":null,"work_id":"7050a891-6f49-4d25-a618-a355df93e887","year":2025},"citing_paper":{"arxiv_id":"2605.21615","last_updated":"2026-05-20T18:23:17Z","snapshot_observed_at":"2026-07-06T23:32:01.202542Z","submitted_at":"2026-05-20T18:23:17Z","title":"ASSEMBLAGE-DEEPHISTORY: A Cross-Build Binary Dataset with Temporal Coverage","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-05-22T09:40:21.746161Z"},"links":{"cited_paper":"/paper/2506.05692","citing_paper":"/paper/2605.21615"},"observation_digest":"sha256:ff566b224f4c5f7ce8edbaff4700c04f972821aac77cc8d12430204f0d455f5c","observation_id":"4fd05067-2171-419b-aed8-656c01488385","resolution":{"observed_at":"2026-05-22T09:41:21.765966Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.05692","last_updated":"2025-06-20T12:42:57Z","snapshot_observed_at":"2026-08-09T09:46:21.168984Z","submitted_at":"2025-06-06T02:48:02Z","title":"SafeGenBench: A Benchmark Framework for Security Vulnerability Detection in LLM-Generated Code","version":3},"cited_work":{"arxiv_id":"2506.05692","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.05692","snapshot_observed_at":"2026-07-04T04:09:34.777136Z","title":"2025.URL:https://arxiv.org/abs/2506.05692","venue":null,"work_id":"7050a891-6f49-4d25-a618-a355df93e887","year":2025},"citing_paper":{"arxiv_id":"2606.19887","last_updated":"2026-06-24T07:42:32Z","snapshot_observed_at":"2026-07-06T23:55:05.932014Z","submitted_at":"2026-06-18T07:46:18Z","title":"FinRED: An Expert-Guided Benchmark Generation and Evaluation Framework for Financial LLM Red-Teaming","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-06-26T17:11:40.088809Z"},"links":{"cited_paper":"/paper/2506.05692","citing_paper":"/paper/2606.19887"},"observation_digest":"sha256:23795fceae37106f911ea0eba820407134969a56939db9c6b5bdadcf214e62b1","observation_id":"4da95db5-56eb-40e7-b1fa-eb2d852ed576","resolution":{"observed_at":"2026-07-04T04:09:34.779477Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.05692","last_updated":"2025-06-20T12:42:57Z","snapshot_observed_at":"2026-08-09T09:46:21.168984Z","submitted_at":"2025-06-06T02:48:02Z","title":"SafeGenBench: A Benchmark Framework for Security Vulnerability Detection in LLM-Generated Code","version":3},"cited_work":{"arxiv_id":"2506.05692","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.05692","snapshot_observed_at":"2026-07-04T04:09:34.777136Z","title":"2025.URL:https://arxiv.org/abs/2506.05692","venue":null,"work_id":"7050a891-6f49-4d25-a618-a355df93e887","year":2025},"citing_paper":{"arxiv_id":"2606.31159","last_updated":"2026-06-30T05:37:39Z","snapshot_observed_at":"2026-08-09T15:10:14.003771Z","submitted_at":"2026-06-30T05:37:39Z","title":"An Empirical Study of Security Calibration in Large Language Models for Code","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-07-01T05:04:41.223743Z"},"links":{"cited_paper":"/paper/2506.05692","citing_paper":"/paper/2606.31159"},"observation_digest":"sha256:5184d47c3d73975e1d7b0ff63dc673e95e9cc45dfe760ce76145ac64ec96df30","observation_id":"9391a7b8-e6cf-48a0-8c26-f446b61fa838","resolution":{"observed_at":"2026-07-01T10:45:43.045640Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.05692","last_updated":"2025-06-20T12:42:57Z","snapshot_observed_at":"2026-08-09T09:46:21.168984Z","submitted_at":"2025-06-06T02:48:02Z","title":"SafeGenBench: A Benchmark Framework for Security Vulnerability Detection in LLM-Generated Code","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.05692","snapshot_observed_at":"2026-07-12T09:44:42.646014Z","title":"Safe- genbench: A benchmark framework for security vulnerability detection in llm-generated code,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.00107","last_updated":"2026-08-02T05:30:57Z","snapshot_observed_at":"2026-08-06T23:24:46.279176Z","submitted_at":"2026-06-30T19:48:35Z","title":"The Illusion of Safety: Multi-Tier Verification of AI vs. Human C++ Code","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-07-12T09:44:42.646014Z"},"links":{"cited_paper":"/paper/2506.05692","citing_paper":"/paper/2607.00107"},"observation_digest":"sha256:09b4f062622cd7b98ac2e9d6fa31b88f7d47bccfaadafcf9dd12ff0e55a5974e","observation_id":"75240d8a-1d5d-40ba-b438-c96b1600794c","resolution":{"observed_at":"2026-07-12T09:44:42.646014Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.05692","last_updated":"2025-06-20T12:42:57Z","snapshot_observed_at":"2026-08-09T09:46:21.168984Z","submitted_at":"2025-06-06T02:48:02Z","title":"SafeGenBench: A Benchmark Framework for Security Vulnerability Detection in LLM-Generated Code","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.05692","snapshot_observed_at":"2026-08-04T04:38:06.679657Z","title":"Safe- genbench: A benchmark framework for security vulnerability detection in llm-generated code,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.00107","last_updated":"2026-08-02T05:30:57Z","snapshot_observed_at":"2026-08-06T23:24:46.279176Z","submitted_at":"2026-06-30T19:48:35Z","title":"The Illusion of Safety: Multi-Tier Verification of AI vs. Human C++ Code","version":3},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-04T04:38:06.679657Z"},"links":{"cited_paper":"/paper/2506.05692","citing_paper":"/paper/2607.00107"},"observation_digest":"sha256:ad86063b1ba1a386f7dc4021fd565b5e5b5c0c3a340b08fe7b8d4502e4ec5212","observation_id":"91d0a92e-fce5-4d73-85f0-61222953f4a8","resolution":{"observed_at":"2026-08-04T04:38:06.679657Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.05692","last_updated":"2025-06-20T12:42:57Z","snapshot_observed_at":"2026-08-09T09:46:21.168984Z","submitted_at":"2025-06-06T02:48:02Z","title":"SafeGenBench: A Benchmark Framework for Security Vulnerability Detection in LLM-Generated Code","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.05692","snapshot_observed_at":"2026-07-13T01:16:30.101870Z","title":"Safegenbench: A benchmark framework for security vulnerability detection in llm-generated code,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.08981","last_updated":"2026-07-09T23:01:54Z","snapshot_observed_at":"2026-08-09T09:47:03.214799Z","submitted_at":"2026-07-09T23:01:54Z","title":"The Patchwork Problem in LLM-Generated Code","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-07-13T01:16:30.101870Z"},"links":{"cited_paper":"/paper/2506.05692","citing_paper":"/paper/2607.08981"},"observation_digest":"sha256:9453d91b30a38f2375935c68a10dcd20452ad04c9a09cca73d1c335570b3cd36","observation_id":"c8762db4-355e-454e-90e2-635ce74067b8","resolution":{"observed_at":"2026-07-13T01:16:30.101870Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.05692","last_updated":"2025-06-20T12:42:57Z","snapshot_observed_at":"2026-08-09T09:46:21.168984Z","submitted_at":"2025-06-06T02:48:02Z","title":"SafeGenBench: A Benchmark Framework for Security Vulnerability Detection in LLM-Generated Code","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.05692","snapshot_observed_at":"2026-08-01T03:40:38.189512Z","title":"arXiv preprint arXiv:2506.05692 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.23088","last_updated":"2026-07-25T07:46:13Z","snapshot_observed_at":"2026-08-07T20:21:12.844414Z","submitted_at":"2026-07-25T07:46:13Z","title":"Poster: Rethinking Security in LLM Code Generation through Real-World Risk Scenarios","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-01T03:40:38.189512Z"},"links":{"cited_paper":"/paper/2506.05692","citing_paper":"/paper/2607.23088"},"observation_digest":"sha256:8a1e6e2d1608997d29e66aa2fb2f669c25474f11dc161858d0d085a390e6a4c3","observation_id":"b212ebb8-7ab2-4f5b-a7ae-95296fd38590","resolution":{"observed_at":"2026-08-01T03:40:38.189512Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.05692","last_updated":"2025-06-20T12:42:57Z","snapshot_observed_at":"2026-08-09T09:46:21.168984Z","submitted_at":"2025-06-06T02:48:02Z","title":"SafeGenBench: A Benchmark Framework for Security Vulnerability Detection in LLM-Generated Code","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.05692","snapshot_observed_at":"2026-08-06T00:29:57.375647Z","title":"SafeGenBench: A Benchmark Framework for Security Vulnerability Detection in LLM-Generated Code,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.03166","last_updated":"2026-08-04T05:54:32Z","snapshot_observed_at":"2026-08-08T00:04:44.793928Z","submitted_at":"2026-08-04T05:54:32Z","title":"Adversarial Stress Testing of Role-Playing Language Agents using Multi-Agent Evaluation","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T00:29:57.375647Z"},"links":{"cited_paper":"/paper/2506.05692","citing_paper":"/paper/2608.03166"},"observation_digest":"sha256:276a362240fd9529ab60794ac560b1ea51edef7b59510128acb022c3f70f5782","observation_id":"c6ca3504-9d98-4ad8-8114-0bcf1183b914","resolution":{"observed_at":"2026-08-06T00:29:57.375647Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2506.05692/citation-record","integrity":"/paper/2506.05692/integrity","json":"/paper/2506.05692/citation-record.json","paper":"/paper/2506.05692"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-07T10:22:09.593636Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.05692","last_updated":"2025-06-20T12:42:57Z","snapshot_observed_at":"2026-08-09T09:46:21.168984Z","submitted_at":"2025-06-06T02:48:02Z","title":"SafeGenBench: A Benchmark Framework for Security Vulnerability Detection in LLM-Generated Code","version":3},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-07T10:22:09.593636Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2506.05692"},"observation_digest":"sha256:16a48fbbdcbb54ca000aa18dfedd6bab86fbd60c9e61803e9dc6a469495fef5d","observation_id":"e945359a-f2d0-4f51-8d09-8d28a05c9a3a","resolution":{"observed_at":"2026-08-07T10:22:09.593636Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:22:09.679322Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05692","last_updated":"2025-06-20T12:42:57Z","snapshot_observed_at":"2026-08-09T09:46:21.168984Z","submitted_at":"2025-06-06T02:48:02Z","title":"SafeGenBench: A Benchmark Framework for Security Vulnerability Detection in LLM-Generated Code","version":3},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-07T10:22:09.679322Z"},"links":{"citing_paper":"/paper/2506.05692"},"observation_digest":"sha256:9a7026bc892e6b6b81d3689d0d8a44625959bc86a35c90782c0e974f608311f9","observation_id":"b50f08a5-c133-4ec9-b83b-a6f13a0c059b","resolution":{"observed_at":"2026-08-07T10:22:09.679322Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2108.07732","last_updated":"2021-08-16T03:57:30Z","snapshot_observed_at":"2026-08-02T19:23:53.535075Z","submitted_at":"2021-08-16T03:57:30Z","title":"Program Synthesis with Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2108.07732","snapshot_observed_at":"2026-08-07T10:22:09.792008Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.05692","last_updated":"2025-06-20T12:42:57Z","snapshot_observed_at":"2026-08-09T09:46:21.168984Z","submitted_at":"2025-06-06T02:48:02Z","title":"SafeGenBench: A Benchmark Framework for Security Vulnerability Detection in LLM-Generated Code","version":3},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-07T10:22:09.792008Z"},"links":{"cited_paper":"/paper/2108.07732","citing_paper":"/paper/2506.05692"},"observation_digest":"sha256:804512b6068384f45f06b55a206e72affe517a41382daea2ad493912e23c2b6a","observation_id":"216ecdb6-fbe3-4a27-a307-06a500fcf67e","resolution":{"observed_at":"2026-08-07T10:22:09.792008Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.13161","last_updated":"2024-04-19T20:11:12Z","snapshot_observed_at":"2026-08-07T13:01:36.699787Z","submitted_at":"2024-04-19T20:11:12Z","title":"CyberSecEval 2: A Wide-Ranging Cybersecurity Evaluation Suite for Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.13161","snapshot_observed_at":"2026-08-07T10:22:09.899584Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05692","last_updated":"2025-06-20T12:42:57Z","snapshot_observed_at":"2026-08-09T09:46:21.168984Z","submitted_at":"2025-06-06T02:48:02Z","title":"SafeGenBench: A Benchmark Framework for Security Vulnerability Detection in LLM-Generated Code","version":3},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-07T10:22:09.899584Z"},"links":{"cited_paper":"/paper/2404.13161","citing_paper":"/paper/2506.05692"},"observation_digest":"sha256:06924de25808ae0047438af0edf625d8852a868a4a64d4e73ee5b136de96b739","observation_id":"c1d011af-ea4f-4971-ad9c-a0ce5add58c1","resolution":{"observed_at":"2026-08-07T10:22:09.899584Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:22:15.992691Z","title":null,"venue":null,"work_id":"9ba566a1-5d3b-4ee6-b3fd-7dd6dc466f54","year":2023},"citing_paper":{"arxiv_id":"2506.05692","last_updated":"2025-06-20T12:42:57Z","snapshot_observed_at":"2026-08-09T09:46:21.168984Z","submitted_at":"2025-06-06T02:48:02Z","title":"SafeGenBench: A Benchmark Framework for Security Vulnerability Detection in LLM-Generated Code","version":3},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-07T10:22:09.985448Z"},"links":{"citing_paper":"/paper/2506.05692"},"observation_digest":"sha256:0f0868a322682a10346c0ea14df8fe5bfbb33a2da1d65cedc1e68384d19f22f0","observation_id":"0e691715-3a62-4b72-bd84-509166a061ed","resolution":{"observed_at":"2026-08-07T10:22:16.061121Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2107.03374","last_updated":"2021-07-14T17:16:02Z","snapshot_observed_at":"2026-08-08T11:58:24.516369Z","submitted_at":"2021-07-07T17:41:24Z","title":"Evaluating Large Language Models Trained on Code","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2107.03374","snapshot_observed_at":"2026-08-07T10:22:10.044592Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.05692","last_updated":"2025-06-20T12:42:57Z","snapshot_observed_at":"2026-08-09T09:46:21.168984Z","submitted_at":"2025-06-06T02:48:02Z","title":"SafeGenBench: A Benchmark Framework for Security Vulnerability Detection in LLM-Generated Code","version":3},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-07T10:22:10.044592Z"},"links":{"cited_paper":"/paper/2107.03374","citing_paper":"/paper/2506.05692"},"observation_digest":"sha256:85642f478a6c4514c92b4469d7f0c3362a0c9c7b9a65357609a9398faa5283ba","observation_id":"0a4b93a5-80ae-4517-ad1e-80a23e487a0a","resolution":{"observed_at":"2026-08-07T10:22:10.044592Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:22:10.124029Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.05692","last_updated":"2025-06-20T12:42:57Z","snapshot_observed_at":"2026-08-09T09:46:21.168984Z","submitted_at":"2025-06-06T02:48:02Z","title":"SafeGenBench: A Benchmark Framework for Security Vulnerability Detection in LLM-Generated Code","version":3},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-07T10:22:10.124029Z"},"links":{"citing_paper":"/paper/2506.05692"},"observation_digest":"sha256:930e550f5fa12372eae24eb26049568abb2e0cc7c9ee2f11ffe0f04b4bd236b3","observation_id":"dd6bb4d7-d8d1-4ddd-bc86-80ea1cd806ca","resolution":{"observed_at":"2026-08-07T10:22:10.124029Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:22:15.859670Z","title":null,"venue":null,"work_id":"b5d34a2d-d3da-4786-b2aa-bcd8396b1856","year":2023},"citing_paper":{"arxiv_id":"2506.05692","last_updated":"2025-06-20T12:42:57Z","snapshot_observed_at":"2026-08-09T09:46:21.168984Z","submitted_at":"2025-06-06T02:48:02Z","title":"SafeGenBench: A Benchmark Framework for Security Vulnerability Detection in LLM-Generated Code","version":3},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-07T10:22:10.200771Z"},"links":{"citing_paper":"/paper/2506.05692"},"observation_digest":"sha256:bb723175813d98ca37b326e9619b925584619232d015a93be6b3066ed543eb51","observation_id":"75522f84-6e98-4d51-b050-418a766786cd","resolution":{"observed_at":"2026-08-07T10:22:15.924317Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.06807","last_updated":"2025-02-18T22:21:40Z","snapshot_observed_at":"2026-08-09T14:06:29.234036Z","submitted_at":"2025-02-03T23:00:15Z","title":"Competitive Programming with Large Reasoning Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.06807","snapshot_observed_at":"2026-08-07T10:22:10.290482Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.05692","last_updated":"2025-06-20T12:42:57Z","snapshot_observed_at":"2026-08-09T09:46:21.168984Z","submitted_at":"2025-06-06T02:48:02Z","title":"SafeGenBench: A Benchmark Framework for Security Vulnerability Detection in LLM-Generated Code","version":3},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-07T10:22:10.290482Z"},"links":{"cited_paper":"/paper/2502.06807","citing_paper":"/paper/2506.05692"},"observation_digest":"sha256:94017b36e28fbd1550e1c210b48e7d677888cb1794aae4a1c1c06bd1e0220070","observation_id":"54ac5407-6ff4-4676-afd7-abc8a2c5a588","resolution":{"observed_at":"2026-08-07T10:22:10.290482Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:22:15.690495Z","title":null,"venue":null,"work_id":"e3ba48c3-9b27-4060-8611-1e0b85b00011","year":2024},"citing_paper":{"arxiv_id":"2506.05692","last_updated":"2025-06-20T12:42:57Z","snapshot_observed_at":"2026-08-09T09:46:21.168984Z","submitted_at":"2025-06-06T02:48:02Z","title":"SafeGenBench: A Benchmark Framework for Security Vulnerability Detection in LLM-Generated Code","version":3},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-07T10:22:10.398449Z"},"links":{"citing_paper":"/paper/2506.05692"},"observation_digest":"sha256:271da576e76c95af33f02e4bb912b1b51315f4f1be5d6947bd8feb13c0a6151b","observation_id":"a74aecec-0ecf-4ba5-b0b6-ed2ff24dcee7","resolution":{"observed_at":"2026-08-07T10:22:15.779157Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:22:15.522258Z","title":null,"venue":null,"work_id":"43885614-3346-48ba-8755-2ddbfc73c33b","year":2025},"citing_paper":{"arxiv_id":"2506.05692","last_updated":"2025-06-20T12:42:57Z","snapshot_observed_at":"2026-08-09T09:46:21.168984Z","submitted_at":"2025-06-06T02:48:02Z","title":"SafeGenBench: A Benchmark Framework for Security Vulnerability Detection in LLM-Generated Code","version":3},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-07T10:22:10.472959Z"},"links":{"citing_paper":"/paper/2506.05692"},"observation_digest":"sha256:507a3626dac4272ec2d7fa50330f513d04b06a40b958bf3b8004f799651a3b5c","observation_id":"ca90c4d6-b648-4479-acc6-42d416283997","resolution":{"observed_at":"2026-08-07T10:22:15.619059Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.15594","last_updated":"2025-10-19T10:32:43Z","snapshot_observed_at":"2026-08-02T10:23:50.881300Z","submitted_at":"2024-11-23T16:03:35Z","title":"A Survey on LLM-as-a-Judge","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.15594","snapshot_observed_at":"2026-08-07T10:22:10.547585Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05692","last_updated":"2025-06-20T12:42:57Z","snapshot_observed_at":"2026-08-09T09:46:21.168984Z","submitted_at":"2025-06-06T02:48:02Z","title":"SafeGenBench: A Benchmark Framework for Security Vulnerability Detection in LLM-Generated Code","version":3},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-07T10:22:10.547585Z"},"links":{"cited_paper":"/paper/2411.15594","citing_paper":"/paper/2506.05692"},"observation_digest":"sha256:422a09d004523e9fff9ae743743a9b0503b2761cac23a61eec7237e12d2a13e6","observation_id":"5b2387c1-c766-4429-8dbb-2a32cbc972a9","resolution":{"observed_at":"2026-08-07T10:22:10.547585Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-07T10:22:10.651198Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.05692","last_updated":"2025-06-20T12:42:57Z","snapshot_observed_at":"2026-08-09T09:46:21.168984Z","submitted_at":"2025-06-06T02:48:02Z","title":"SafeGenBench: A Benchmark Framework for Security Vulnerability Detection in LLM-Generated Code","version":3},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-07T10:22:10.651198Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2506.05692"},"observation_digest":"sha256:91b57e5dc37fbed127be0c0b42624c20953ec6487906f49e9ab6f3e2478d9c7f","observation_id":"002a785b-e291-460c-a881-aa33c1898720","resolution":{"observed_at":"2026-08-07T10:22:10.651198Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.14196","last_updated":"2024-01-26T09:23:11Z","snapshot_observed_at":"2026-08-06T22:40:28.707813Z","submitted_at":"2024-01-25T14:17:53Z","title":"DeepSeek-Coder: When the Large Language Model Meets Programming -- The Rise of Code Intelligence","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.14196","snapshot_observed_at":"2026-08-07T10:22:10.730473Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05692","last_updated":"2025-06-20T12:42:57Z","snapshot_observed_at":"2026-08-09T09:46:21.168984Z","submitted_at":"2025-06-06T02:48:02Z","title":"SafeGenBench: A Benchmark Framework for Security Vulnerability Detection in LLM-Generated Code","version":3},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-07T10:22:10.730473Z"},"links":{"cited_paper":"/paper/2401.14196","citing_paper":"/paper/2506.05692"},"observation_digest":"sha256:f4afa1cdbcd83c3dea4731420b0f58040ec3798f25f11b1979a6ecb56e4eee70","observation_id":"363192a3-d130-4cae-9feb-bcd9bf737d5f","resolution":{"observed_at":"2026-08-07T10:22:10.730473Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:22:10.792739Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05692","last_updated":"2025-06-20T12:42:57Z","snapshot_observed_at":"2026-08-09T09:46:21.168984Z","submitted_at":"2025-06-06T02:48:02Z","title":"SafeGenBench: A Benchmark Framework for Security Vulnerability Detection in LLM-Generated Code","version":3},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-07T10:22:10.792739Z"},"links":{"citing_paper":"/paper/2506.05692"},"observation_digest":"sha256:64670d5672846e3cfe042fbf98ffc21fba2400ad6531b0473eb62a56840cbfa9","observation_id":"36496748-a3f8-43d8-aef6-673899a281eb","resolution":{"observed_at":"2026-08-07T10:22:10.792739Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2105.09938","last_updated":"2021-11-08T21:16:44Z","snapshot_observed_at":"2026-08-04T23:13:25.514661Z","submitted_at":"2021-05-20T17:58:42Z","title":"Measuring Coding Challenge Competence With APPS","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2105.09938","snapshot_observed_at":"2026-08-07T10:22:10.915468Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.05692","last_updated":"2025-06-20T12:42:57Z","snapshot_observed_at":"2026-08-09T09:46:21.168984Z","submitted_at":"2025-06-06T02:48:02Z","title":"SafeGenBench: A Benchmark Framework for Security Vulnerability Detection in LLM-Generated Code","version":3},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-07T10:22:10.915468Z"},"links":{"cited_paper":"/paper/2105.09938","citing_paper":"/paper/2506.05692"},"observation_digest":"sha256:482de09069f9128620ed921a17c1db0aebf4a48a88ba03b2a411cba7bc9d8a06","observation_id":"ed26c410-65bb-45b0-9715-9a2930e0d07e","resolution":{"observed_at":"2026-08-07T10:22:10.915468Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16720","last_updated":"2026-04-30T02:46:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-21T18:04:31Z","title":"OpenAI o1 System Card","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.16720","snapshot_observed_at":"2026-08-07T10:22:11.026518Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05692","last_updated":"2025-06-20T12:42:57Z","snapshot_observed_at":"2026-08-09T09:46:21.168984Z","submitted_at":"2025-06-06T02:48:02Z","title":"SafeGenBench: A Benchmark Framework for Security Vulnerability Detection in LLM-Generated Code","version":3},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-07T10:22:11.026518Z"},"links":{"cited_paper":"/paper/2412.16720","citing_paper":"/paper/2506.05692"},"observation_digest":"sha256:58f99cb156350250607a0bd11f78a5afbb390d6f5d7e6a9cf6df9b9bdc5bfb28","observation_id":"77673158-a6bb-4a09-b582-da48cb1dbac3","resolution":{"observed_at":"2026-08-07T10:22:11.026518Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.07974","last_updated":"2024-06-06T17:41:21Z","snapshot_observed_at":"2026-08-10T03:07:35.408836Z","submitted_at":"2024-03-12T17:58:04Z","title":"LiveCodeBench: Holistic and Contamination Free Evaluation of Large Language Models for Code","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.07974","snapshot_observed_at":"2026-08-07T10:22:11.118778Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05692","last_updated":"2025-06-20T12:42:57Z","snapshot_observed_at":"2026-08-09T09:46:21.168984Z","submitted_at":"2025-06-06T02:48:02Z","title":"SafeGenBench: A Benchmark Framework for Security Vulnerability Detection in LLM-Generated Code","version":3},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-07T10:22:11.118778Z"},"links":{"cited_paper":"/paper/2403.07974","citing_paper":"/paper/2506.05692"},"observation_digest":"sha256:f7a679ec52295c83d2564ac0c0c01c7cc3609af4738851ad8f5511094c965e22","observation_id":"61d8ef6e-bf01-4a7e-b77f-5c445edccef0","resolution":{"observed_at":"2026-08-07T10:22:11.118778Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.18260","last_updated":"2025-01-05T14:59:57Z","snapshot_observed_at":"2026-08-07T10:41:43.549152Z","submitted_at":"2024-12-24T08:20:29Z","title":"Investigating Large Language Models for Code Vulnerability Detection: An Experimental Study","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.18260","snapshot_observed_at":"2026-08-07T10:22:11.210282Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05692","last_updated":"2025-06-20T12:42:57Z","snapshot_observed_at":"2026-08-09T09:46:21.168984Z","submitted_at":"2025-06-06T02:48:02Z","title":"SafeGenBench: A Benchmark Framework for Security Vulnerability Detection in LLM-Generated Code","version":3},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-07T10:22:11.210282Z"},"links":{"cited_paper":"/paper/2412.18260","citing_paper":"/paper/2506.05692"},"observation_digest":"sha256:1ce7e31900dc99897018c68635eaab4e40b9e900011c83ba9c1238effd1359bd","observation_id":"709a49c8-a7b6-47ae-a80a-b3d99e8bdf4e","resolution":{"observed_at":"2026-08-07T10:22:11.210282Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:22:11.315557Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05692","last_updated":"2025-06-20T12:42:57Z","snapshot_observed_at":"2026-08-09T09:46:21.168984Z","submitted_at":"2025-06-06T02:48:02Z","title":"SafeGenBench: A Benchmark Framework for Security Vulnerability Detection in LLM-Generated Code","version":3},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-07T10:22:11.315557Z"},"links":{"citing_paper":"/paper/2506.05692"},"observation_digest":"sha256:4d9d04eb4a33eba050f0f76d753660ecae07e39bb7c8c164ea3b023d1fd1dc59","observation_id":"a19e61cf-e864-4692-991e-f3e6e21f57a0","resolution":{"observed_at":"2026-08-07T10:22:11.315557Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:22:15.349494Z","title":null,"venue":null,"work_id":"55aab7e1-c68e-41e0-a0e3-8cafffba3721","year":2023},"citing_paper":{"arxiv_id":"2506.05692","last_updated":"2025-06-20T12:42:57Z","snapshot_observed_at":"2026-08-09T09:46:21.168984Z","submitted_at":"2025-06-06T02:48:02Z","title":"SafeGenBench: A Benchmark Framework for Security Vulnerability Detection in LLM-Generated Code","version":3},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-07T10:22:11.405590Z"},"links":{"citing_paper":"/paper/2506.05692"},"observation_digest":"sha256:98090846c2e93083cb54dd58ecc630a0dd304a79903bd8d761012e5dacd30ace","observation_id":"b7a52fed-7a47-4295-9330-c45b6301c3f2","resolution":{"observed_at":"2026-08-07T10:22:15.441597Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:22:15.237409Z","title":null,"venue":null,"work_id":"f6818c50-3152-43df-9ddd-0527b44f0f0a","year":2020},"citing_paper":{"arxiv_id":"2506.05692","last_updated":"2025-06-20T12:42:57Z","snapshot_observed_at":"2026-08-09T09:46:21.168984Z","submitted_at":"2025-06-06T02:48:02Z","title":"SafeGenBench: A Benchmark Framework for Security Vulnerability Detection in LLM-Generated Code","version":3},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-07T10:22:11.469477Z"},"links":{"citing_paper":"/paper/2506.05692"},"observation_digest":"sha256:23a32179718ad392e0345dc2b152fd3881fa03e1ee37a5fcfd7b37bbda193d5d","observation_id":"b562392e-e503-40db-ac6c-defa0a008dce","resolution":{"observed_at":"2026-08-07T10:22:15.292832Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:22:11.560456Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.05692","last_updated":"2025-06-20T12:42:57Z","snapshot_observed_at":"2026-08-09T09:46:21.168984Z","submitted_at":"2025-06-06T02:48:02Z","title":"SafeGenBench: A Benchmark Framework for Security Vulnerability Detection in LLM-Generated Code","version":3},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-07T10:22:11.560456Z"},"links":{"citing_paper":"/paper/2506.05692"},"observation_digest":"sha256:5881449e341793daf9ee81c5d255565f52c9bd23c2b01001d40f83e3ac9b5f44","observation_id":"50a6dc41-d18d-4aef-9878-0a1bbbc5ecaf","resolution":{"observed_at":"2026-08-07T10:22:11.560456Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.19437","last_updated":"2025-02-18T17:26:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-27T04:03:16Z","title":"DeepSeek-V3 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.19437","snapshot_observed_at":"2026-08-07T10:22:11.638747Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05692","last_updated":"2025-06-20T12:42:57Z","snapshot_observed_at":"2026-08-09T09:46:21.168984Z","submitted_at":"2025-06-06T02:48:02Z","title":"SafeGenBench: A Benchmark Framework for Security Vulnerability Detection in LLM-Generated Code","version":3},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-07T10:22:11.638747Z"},"links":{"cited_paper":"/paper/2412.19437","citing_paper":"/paper/2506.05692"},"observation_digest":"sha256:3416d988f5d25e3a07785b84af44a51759dbc3609a22b7d9844d0baca5dba7b1","observation_id":"d2c0ba74-3156-4bca-9bce-11714833ca47","resolution":{"observed_at":"2026-08-07T10:22:11.638747Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:22:15.103237Z","title":null,"venue":null,"work_id":"07dee3ce-80b7-4da5-b012-576579ddbfcf","year":2023},"citing_paper":{"arxiv_id":"2506.05692","last_updated":"2025-06-20T12:42:57Z","snapshot_observed_at":"2026-08-09T09:46:21.168984Z","submitted_at":"2025-06-06T02:48:02Z","title":"SafeGenBench: A Benchmark Framework for Security Vulnerability Detection in LLM-Generated Code","version":3},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-07T10:22:11.743316Z"},"links":{"citing_paper":"/paper/2506.05692"},"observation_digest":"sha256:fadf32c9d3d2572da8e08f26233f3cb92a62cf884254750490d5d7d37b8996db","observation_id":"aca5a2c8-d3f9-4798-8682-4d5db10a7bb6","resolution":{"observed_at":"2026-08-07T10:22:15.154345Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.00899","last_updated":"2024-09-04T06:19:08Z","snapshot_observed_at":"2026-08-09T15:51:22.713471Z","submitted_at":"2024-09-02T02:24:38Z","title":"MarsCode Agent: AI-native Automated Bug Fixing","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.00899","snapshot_observed_at":"2026-08-07T10:22:11.875131Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05692","last_updated":"2025-06-20T12:42:57Z","snapshot_observed_at":"2026-08-09T09:46:21.168984Z","submitted_at":"2025-06-06T02:48:02Z","title":"SafeGenBench: A Benchmark Framework for Security Vulnerability Detection in LLM-Generated Code","version":3},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-07T10:22:11.875131Z"},"links":{"cited_paper":"/paper/2409.00899","citing_paper":"/paper/2506.05692"},"observation_digest":"sha256:372318fc9dc6f290a26177bbbca62b9f764339bdb4310189e9c612df90dd9d4e","observation_id":"9fcd9956-69b8-42e5-8fb7-642b93f2fb9e","resolution":{"observed_at":"2026-08-07T10:22:11.875131Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.19173","last_updated":"2024-02-29T13:53:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-02-29T13:53:35Z","title":"StarCoder 2 and The Stack v2: The Next Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.19173","snapshot_observed_at":"2026-08-07T10:22:12.018305Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05692","last_updated":"2025-06-20T12:42:57Z","snapshot_observed_at":"2026-08-09T09:46:21.168984Z","submitted_at":"2025-06-06T02:48:02Z","title":"SafeGenBench: A Benchmark Framework for Security Vulnerability Detection in LLM-Generated Code","version":3},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-07T10:22:12.018305Z"},"links":{"cited_paper":"/paper/2402.19173","citing_paper":"/paper/2506.05692"},"observation_digest":"sha256:49d7b25cbfb9845b1d1d7481d6e383ba771d37101f29a84cbaad2f23c6b1eeac","observation_id":"e5f8f7c1-6e73-47dd-a758-bb6ca3d9d522","resolution":{"observed_at":"2026-08-07T10:22:12.018305Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:22:14.916347Z","title":null,"venue":null,"work_id":"8bc0920d-1015-44f0-b0ae-b1e753a1a772","year":2025},"citing_paper":{"arxiv_id":"2506.05692","last_updated":"2025-06-20T12:42:57Z","snapshot_observed_at":"2026-08-09T09:46:21.168984Z","submitted_at":"2025-06-06T02:48:02Z","title":"SafeGenBench: A Benchmark Framework for Security Vulnerability Detection in LLM-Generated Code","version":3},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-07T10:22:12.109822Z"},"links":{"citing_paper":"/paper/2506.05692"},"observation_digest":"sha256:bde4f00d790051f30a593d4657266a8568ee934ef42b65c2e079868bc47b0253","observation_id":"ff0ee46d-b13f-48a1-9348-cccd1637a82b","resolution":{"observed_at":"2026-08-07T10:22:15.001834Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:22:14.757631Z","title":null,"venue":null,"work_id":"c8a1e352-3d9a-42ef-8c0c-a727698694bc","year":2024},"citing_paper":{"arxiv_id":"2506.05692","last_updated":"2025-06-20T12:42:57Z","snapshot_observed_at":"2026-08-09T09:46:21.168984Z","submitted_at":"2025-06-06T02:48:02Z","title":"SafeGenBench: A Benchmark Framework for Security Vulnerability Detection in LLM-Generated Code","version":3},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-07T10:22:12.282471Z"},"links":{"citing_paper":"/paper/2506.05692"},"observation_digest":"sha256:e27806f46a791c773a4d45e400591dedab6b6829aefc8297ed610198d1d08eae","observation_id":"498135e9-565c-47c1-8dbd-3381fac4460a","resolution":{"observed_at":"2026-08-07T10:22:14.818106Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:22:14.610478Z","title":null,"venue":null,"work_id":"2a807072-8218-4c5c-9ead-cf558b0dfdaf","year":2025},"citing_paper":{"arxiv_id":"2506.05692","last_updated":"2025-06-20T12:42:57Z","snapshot_observed_at":"2026-08-09T09:46:21.168984Z","submitted_at":"2025-06-06T02:48:02Z","title":"SafeGenBench: A Benchmark Framework for Security Vulnerability Detection in LLM-Generated Code","version":3},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-07T10:22:12.423058Z"},"links":{"citing_paper":"/paper/2506.05692"},"observation_digest":"sha256:94fc4d421c71349e5c2ad696832f079dddd549b689c69e29f1a1f81e99228295","observation_id":"91895404-3140-453a-b3cd-bc9b08e6b070","resolution":{"observed_at":"2026-08-07T10:22:14.688688Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:22:14.450399Z","title":null,"venue":null,"work_id":"5b40281f-8e0b-4313-9bd8-f013c5597105","year":2021},"citing_paper":{"arxiv_id":"2506.05692","last_updated":"2025-06-20T12:42:57Z","snapshot_observed_at":"2026-08-09T09:46:21.168984Z","submitted_at":"2025-06-06T02:48:02Z","title":"SafeGenBench: A Benchmark Framework for Security Vulnerability Detection in LLM-Generated Code","version":3},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-07T10:22:12.578595Z"},"links":{"citing_paper":"/paper/2506.05692"},"observation_digest":"sha256:6b65ac4a30ce5475f2b49bac67c9cf1533f6e4cb7575eff136d6f43a9aba1321","observation_id":"93341358-3a43-4082-8ef6-78c9156449c7","resolution":{"observed_at":"2026-08-07T10:22:14.532416Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:22:12.706363Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.05692","last_updated":"2025-06-20T12:42:57Z","snapshot_observed_at":"2026-08-09T09:46:21.168984Z","submitted_at":"2025-06-06T02:48:02Z","title":"SafeGenBench: A Benchmark Framework for Security Vulnerability Detection in LLM-Generated Code","version":3},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-07T10:22:12.706363Z"},"links":{"citing_paper":"/paper/2506.05692"},"observation_digest":"sha256:660fd67b4ecd3077b2417c805b368401f76803bd5b4341d64b2b5b8a1533c785","observation_id":"1d4488ce-8ecc-44c4-8328-e777b422a9c9","resolution":{"observed_at":"2026-08-07T10:22:12.706363Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.08200","last_updated":"2025-01-14T15:27:01Z","snapshot_observed_at":"2026-08-10T04:24:06.417632Z","submitted_at":"2025-01-14T15:27:01Z","title":"CWEval: Outcome-driven Evaluation on Functionality and Security of LLM Code Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.08200","snapshot_observed_at":"2026-08-07T10:22:12.808455Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.05692","last_updated":"2025-06-20T12:42:57Z","snapshot_observed_at":"2026-08-09T09:46:21.168984Z","submitted_at":"2025-06-06T02:48:02Z","title":"SafeGenBench: A Benchmark Framework for Security Vulnerability Detection in LLM-Generated Code","version":3},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-07T10:22:12.808455Z"},"links":{"cited_paper":"/paper/2501.08200","citing_paper":"/paper/2506.05692"},"observation_digest":"sha256:d2af6b878ac5e0d6269827dfa61c8eb389efa23a569753e4610d42dcf76a4963","observation_id":"28da7e5f-0abb-41d8-9b7b-0d3af409a614","resolution":{"observed_at":"2026-08-07T10:22:12.808455Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:22:14.222771Z","title":null,"venue":null,"work_id":"3c796910-d9e8-46fb-92f8-387f97a1d6b5","year":2025},"citing_paper":{"arxiv_id":"2506.05692","last_updated":"2025-06-20T12:42:57Z","snapshot_observed_at":"2026-08-09T09:46:21.168984Z","submitted_at":"2025-06-06T02:48:02Z","title":"SafeGenBench: A Benchmark Framework for Security Vulnerability Detection in LLM-Generated Code","version":3},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-07T10:22:12.902766Z"},"links":{"citing_paper":"/paper/2506.05692"},"observation_digest":"sha256:e51a459ab17b1ff9625ea2f0d5d3114802ac08d46140521ddc4b49ee57314785","observation_id":"333f791c-c1b9-424e-993d-6973fd3be9f2","resolution":{"observed_at":"2026-08-07T10:22:14.311152Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:22:14.135787Z","title":null,"venue":null,"work_id":"8bd92f59-efc9-4971-bf53-7a4d145b098a","year":2025},"citing_paper":{"arxiv_id":"2506.05692","last_updated":"2025-06-20T12:42:57Z","snapshot_observed_at":"2026-08-09T09:46:21.168984Z","submitted_at":"2025-06-06T02:48:02Z","title":"SafeGenBench: A Benchmark Framework for Security Vulnerability Detection in LLM-Generated Code","version":3},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-07T10:22:12.994276Z"},"links":{"citing_paper":"/paper/2506.05692"},"observation_digest":"sha256:72467a8fe77296b95530a8e1364c603dabf55fb1d4545013ae22b3d01574693a","observation_id":"b9825af3-d8f0-43e2-9445-5be0fcebffdf","resolution":{"observed_at":"2026-08-07T10:22:14.180190Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1007/978-3-031-76934-4_7","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:03:56.115653Z","title":null,"venue":"Lecture notes in computer science","work_id":"36b61c81-2c2a-4dd9-8f60-7f20a94a0355","year":2024},"citing_paper":{"arxiv_id":"2506.05692","last_updated":"2025-06-20T12:42:57Z","snapshot_observed_at":"2026-08-09T09:46:21.168984Z","submitted_at":"2025-06-06T02:48:02Z","title":"SafeGenBench: A Benchmark Framework for Security Vulnerability Detection in LLM-Generated Code","version":3},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-07T10:22:13.105707Z"},"links":{"citing_paper":"/paper/2506.05692"},"observation_digest":"sha256:cceeb6554635cac5bb17b6a6ea0daf9b757b682ac320c04b6664b78eccc698a0","observation_id":"4ffe3f07-a005-4d2c-ab75-a4fc650549ee","resolution":{"observed_at":"2026-08-07T10:22:13.668860Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.10490","last_updated":"2024-09-16T17:23:00Z","snapshot_observed_at":"2026-08-06T02:17:29.603018Z","submitted_at":"2024-09-16T17:23:00Z","title":"Code Vulnerability Detection: A Comparative Analysis of Emerging Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.10490","snapshot_observed_at":"2026-08-07T10:22:13.230288Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05692","last_updated":"2025-06-20T12:42:57Z","snapshot_observed_at":"2026-08-09T09:46:21.168984Z","submitted_at":"2025-06-06T02:48:02Z","title":"SafeGenBench: A Benchmark Framework for Security Vulnerability Detection in LLM-Generated Code","version":3},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-07T10:22:13.230288Z"},"links":{"cited_paper":"/paper/2409.10490","citing_paper":"/paper/2506.05692"},"observation_digest":"sha256:98f387c1d2047c84c9b40811f3a5c87df6370609ff632d8d6678c611fd2f15c2","observation_id":"0964962b-d080-480e-a05a-7ba431423254","resolution":{"observed_at":"2026-08-07T10:22:13.230288Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:22:13.361543Z","title":"online\" 'onlinestring :=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.05692","last_updated":"2025-06-20T12:42:57Z","snapshot_observed_at":"2026-08-09T09:46:21.168984Z","submitted_at":"2025-06-06T02:48:02Z","title":"SafeGenBench: A Benchmark Framework for Security Vulnerability Detection in LLM-Generated Code","version":3},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-07T10:22:13.361543Z"},"links":{"citing_paper":"/paper/2506.05692"},"observation_digest":"sha256:74f2ba0e0eeff1aff2bd6f8ca81126749abc090654ad4b8ee3975e71b1cb8496","observation_id":"5f7b621f-2d9b-4c06-a54b-0ad68f438aa8","resolution":{"observed_at":"2026-08-07T10:22:13.361543Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:22:13.453350Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.05692","last_updated":"2025-06-20T12:42:57Z","snapshot_observed_at":"2026-08-09T09:46:21.168984Z","submitted_at":"2025-06-06T02:48:02Z","title":"SafeGenBench: A Benchmark Framework for Security Vulnerability Detection in LLM-Generated Code","version":3},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-07T10:22:13.453350Z"},"links":{"citing_paper":"/paper/2506.05692"},"observation_digest":"sha256:52e764ed08dce1098c2b6e6e2dc687a2a16361582367f6f010b527462420135b","observation_id":"4a8c1799-e424-4665-8b53-1d81b39c0d42","resolution":{"observed_at":"2026-08-07T10:22:13.453350Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2506.05692","last_updated":"2025-06-20T12:42:57Z","latest_version":3,"primary_category":"cs.CR","snapshot_observed_at":"2026-08-09T09:46:21.168984Z","submitted_at":"2025-06-06T02:48:02Z","title":"SafeGenBench: A Benchmark Framework for Security Vulnerability Detection in LLM-Generated Code"},"reference_resolution":{"displayed":39,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":38,"verified_exact":1,"verified_fuzzy":0},"total_outbound_references":39},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 39 of 39 outbound references and 14 inbound Pith citation observations for arXiv:2506.05692."}