{"as_of":"2026-08-22T14:49:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:e8677eb0d09650821c642d3d9933c6f03be42899e6598f05c57a34df2d85caf9","coverage":[{"denominator":22,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":22,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T21:23:33.680086Z","state":"measured"},{"denominator":24,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":24,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-22T06:32:14.747728+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-16T11:08:52.579973Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-16T11:08:54.189638Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2411.08813","last_updated":"2024-11-13T17:51:57Z","snapshot_observed_at":"2026-08-19T09:02:12.405928Z","submitted_at":"2024-11-13T17:51:57Z","title":"Rethinking CyberSecEval: An LLM-Aided Approach to Evaluation Critique","version":1},"cited_work":{"arxiv_id":"2411.08813","doi":null,"metadata_source":"pith","pith_arxiv_id":"2411.08813","snapshot_observed_at":"2026-08-16T11:08:54.189638Z","title":"Rethinking CyberSecEval: An LLM-Aided Approach to Evaluation Critique","venue":"cs.AI","work_id":"1ba01e47-fc47-40ea-b531-2d36e36fdf8b","year":2024},"citing_paper":{"arxiv_id":"2504.16429","last_updated":"2025-04-23T05:27:27Z","snapshot_observed_at":"2026-08-20T03:49:34.207162Z","submitted_at":"2025-04-23T05:27:27Z","title":"Give LLMs a Security Course: Securing Retrieval-Augmented Code Generation via Knowledge Injection","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-16T11:08:52.579973Z"},"links":{"cited_paper":"/paper/2411.08813","citing_paper":"/paper/2504.16429"},"observation_digest":"sha256:62eeb8f5de210fd0c6045e7103b701d547cfb3bdd3709b7a53e2fc0d9ba2fc1b","observation_id":"3c598cbb-952b-4a90-8b7c-c2fb276ad48b","resolution":{"observed_at":"2026-08-16T11:08:54.264098Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.08813","last_updated":"2024-11-13T17:51:57Z","snapshot_observed_at":"2026-08-19T09:02:12.405928Z","submitted_at":"2024-11-13T17:51:57Z","title":"Rethinking CyberSecEval: An LLM-Aided Approach to Evaluation Critique","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.08813","snapshot_observed_at":"2026-08-03T23:50:49.232342Z","title":"Rethinking cyberseceval: An llm-aided approach to evaluation critique,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2511.03898","last_updated":"2025-11-05T22:46:24Z","snapshot_observed_at":"2026-08-17T23:08:03.289536Z","submitted_at":"2025-11-05T22:46:24Z","title":"Secure Code Generation at Scale with Reflexion","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-03T23:50:49.232342Z"},"links":{"cited_paper":"/paper/2411.08813","citing_paper":"/paper/2511.03898"},"observation_digest":"sha256:30d5c5809ba3288cee66469363cfb71e259f72fb691556d1e2a8a41cd9951c24","observation_id":"d5e2da5e-bbbe-4567-a33b-8b8711e59f40","resolution":{"observed_at":"2026-08-03T23:50:49.232342Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2411.08813/citation-record","integrity":"/paper/2411.08813/integrity","json":"/paper/2411.08813/citation-record.json","paper":"/paper/2411.08813"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2312.04724","last_updated":"2023-12-07T22:07:54Z","snapshot_observed_at":"2026-08-19T12:42:32.480799Z","submitted_at":"2023-12-07T22:07:54Z","title":"Purple Llama CyberSecEval: A Secure Coding Benchmark for Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.04724","snapshot_observed_at":"2026-08-12T21:23:33.424186Z","title":"Purple llama cyberseceval: A secure coding benchmark for language models, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.08813","last_updated":"2024-11-13T17:51:57Z","snapshot_observed_at":"2026-08-19T09:02:12.405928Z","submitted_at":"2024-11-13T17:51:57Z","title":"Rethinking CyberSecEval: An LLM-Aided Approach to Evaluation Critique","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-12T21:23:33.424186Z"},"links":{"cited_paper":"/paper/2312.04724","citing_paper":"/paper/2411.08813"},"observation_digest":"sha256:535c9f696ed32c196fa94a8d33e50a8dc0693d79a69e9aa2c5c8be45a03579cc","observation_id":"dc0008f8-dfc7-45ed-827f-313574a9c126","resolution":{"observed_at":"2026-08-12T21:23:33.424186Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.13161","last_updated":"2024-04-19T20:11:12Z","snapshot_observed_at":"2026-08-19T22:01:43.251521Z","submitted_at":"2024-04-19T20:11:12Z","title":"CyberSecEval 2: A Wide-Ranging Cybersecurity Evaluation Suite for Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.13161","snapshot_observed_at":"2026-08-12T21:23:33.471691Z","title":"Cyberseceval 2: A wide-ranging cybersecurity evaluation suite for large language models, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.08813","last_updated":"2024-11-13T17:51:57Z","snapshot_observed_at":"2026-08-19T09:02:12.405928Z","submitted_at":"2024-11-13T17:51:57Z","title":"Rethinking CyberSecEval: An LLM-Aided Approach to Evaluation Critique","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-12T21:23:33.471691Z"},"links":{"cited_paper":"/paper/2404.13161","citing_paper":"/paper/2411.08813"},"observation_digest":"sha256:f54751f4b63ae4cf214a2555d4ea9031c4d1cc7d3b21e438c462a4d0bd426f17","observation_id":"e17d0dc0-e8d4-46e3-8385-da6f85a08d9d","resolution":{"observed_at":"2026-08-12T21:23:33.471691Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T21:23:34.728497Z","title":"Common Weakness Enumeration","venue":null,"work_id":"ac0fb5a4-15bd-4cef-a26c-0ea7d73b30d4","year":2023},"citing_paper":{"arxiv_id":"2411.08813","last_updated":"2024-11-13T17:51:57Z","snapshot_observed_at":"2026-08-19T09:02:12.405928Z","submitted_at":"2024-11-13T17:51:57Z","title":"Rethinking CyberSecEval: An LLM-Aided Approach to Evaluation Critique","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-12T21:23:33.522370Z"},"links":{"citing_paper":"/paper/2411.08813"},"observation_digest":"sha256:56b718b15afc2d940fe7af58d8b7e5a174c675aef876ab2b687f78c8827cab7f","observation_id":"9e79be6e-43be-41a1-a73e-32c480cb72f8","resolution":{"observed_at":"2026-08-12T21:23:34.733229Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T21:23:34.712159Z","title":"Common Weakness Enumeration","venue":null,"work_id":"707d46b5-d635-41c9-9995-6c42467c6408","year":2023},"citing_paper":{"arxiv_id":"2411.08813","last_updated":"2024-11-13T17:51:57Z","snapshot_observed_at":"2026-08-19T09:02:12.405928Z","submitted_at":"2024-11-13T17:51:57Z","title":"Rethinking CyberSecEval: An LLM-Aided Approach to Evaluation Critique","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-12T21:23:33.560177Z"},"links":{"citing_paper":"/paper/2411.08813"},"observation_digest":"sha256:62da9c69f3a2fee5ad7478be6c0000be66e948f348e345a66c8d4508ebf272a8","observation_id":"b65cbe64-8059-4091-841f-d6abdafbfcbc","resolution":{"observed_at":"2026-08-12T21:23:34.717042Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T21:23:34.697194Z","title":"Semgrep: Lightweight static analysis for many languages","venue":null,"work_id":"277bf4dd-834e-48a4-9a64-55d49e140b6f","year":2024},"citing_paper":{"arxiv_id":"2411.08813","last_updated":"2024-11-13T17:51:57Z","snapshot_observed_at":"2026-08-19T09:02:12.405928Z","submitted_at":"2024-11-13T17:51:57Z","title":"Rethinking CyberSecEval: An LLM-Aided Approach to Evaluation Critique","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-12T21:23:33.565662Z"},"links":{"citing_paper":"/paper/2411.08813"},"observation_digest":"sha256:de06ee4f8618fc7532bbf0e0a804f31883ca4d255e2f720e44869e294c32680c","observation_id":"55b76bea-45fc-40fc-b74f-055aa0a4f28a","resolution":{"observed_at":"2026-08-12T21:23:34.701977Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T21:23:34.597237Z","title":"Cyberseceval 3: Advancing the evaluation of cybersecurity risks and capabilities in large language models,","venue":null,"work_id":"53d3327c-b003-42d8-93df-20653745e72a","year":null},"citing_paper":{"arxiv_id":"2411.08813","last_updated":"2024-11-13T17:51:57Z","snapshot_observed_at":"2026-08-19T09:02:12.405928Z","submitted_at":"2024-11-13T17:51:57Z","title":"Rethinking CyberSecEval: An LLM-Aided Approach to Evaluation Critique","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-12T21:23:33.570960Z"},"links":{"citing_paper":"/paper/2411.08813"},"observation_digest":"sha256:1836d432bf0708b4c5f3111a06e836d71cbec5e683827af2b17c31329ae0169f","observation_id":"7233fb6d-c203-4310-beb1-4f0023c08e30","resolution":{"observed_at":"2026-08-12T21:23:34.649360Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T21:23:34.295714Z","title":"Our goal was to demonstrate statistical variability between our work and Meta’s previous work, we demonstrate this by highlighting percentage point residuals in Section 2","venue":null,"work_id":"d7e86c91-a649-4969-aec0-e72daa3fcc9f","year":null},"citing_paper":{"arxiv_id":"2411.08813","last_updated":"2024-11-13T17:51:57Z","snapshot_observed_at":"2026-08-19T09:02:12.405928Z","submitted_at":"2024-11-13T17:51:57Z","title":"Rethinking CyberSecEval: An LLM-Aided Approach to Evaluation Critique","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-12T21:23:33.615314Z"},"links":{"citing_paper":"/paper/2411.08813"},"observation_digest":"sha256:89a06fbed4eebe82cb8f0ed1f403e0e57ba2829af507b1169200b8bfc6f8d7d0","observation_id":"c56cd304-26ef-4b64-b7e7-229c15a6fa3b","resolution":{"observed_at":"2026-08-12T21:23:34.405324Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T21:23:34.527169Z","title":"This is reflected in our experiments and results","venue":null,"work_id":"9eb61138-83d6-4772-b5e3-8f5c4f7964a8","year":null},"citing_paper":{"arxiv_id":"2411.08813","last_updated":"2024-11-13T17:51:57Z","snapshot_observed_at":"2026-08-19T09:02:12.405928Z","submitted_at":"2024-11-13T17:51:57Z","title":"Rethinking CyberSecEval: An LLM-Aided Approach to Evaluation Critique","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-12T21:23:33.581798Z"},"links":{"citing_paper":"/paper/2411.08813"},"observation_digest":"sha256:215257861eb792c05497e50b964dc10469c032fb5115a52315026840270fd7e3","observation_id":"13311f67-440b-4466-941f-f69621516aa6","resolution":{"observed_at":"2026-08-12T21:23:34.532247Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T21:23:34.512303Z","title":"Limitations","venue":null,"work_id":"59d2914d-a708-42f7-a8d5-16bf11cf275b","year":null},"citing_paper":{"arxiv_id":"2411.08813","last_updated":"2024-11-13T17:51:57Z","snapshot_observed_at":"2026-08-19T09:02:12.405928Z","submitted_at":"2024-11-13T17:51:57Z","title":"Rethinking CyberSecEval: An LLM-Aided Approach to Evaluation Critique","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-12T21:23:33.587192Z"},"links":{"citing_paper":"/paper/2411.08813"},"observation_digest":"sha256:b2f569cb5114fd770192a00589a89dfd2d3fdb3472070e1200c90b4f11a8b130","observation_id":"34352644-6cb7-427a-b988-8f1c1d5e729e","resolution":{"observed_at":"2026-08-12T21:23:34.517128Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T21:23:34.496302Z","title":"Guidelines: • The answer NA means that the paper does not include theoretical results","venue":null,"work_id":"d03b8c9a-ade8-46a0-b213-cf8502e2d94a","year":null},"citing_paper":{"arxiv_id":"2411.08813","last_updated":"2024-11-13T17:51:57Z","snapshot_observed_at":"2026-08-19T09:02:12.405928Z","submitted_at":"2024-11-13T17:51:57Z","title":"Rethinking CyberSecEval: An LLM-Aided Approach to Evaluation Critique","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-12T21:23:33.592485Z"},"links":{"citing_paper":"/paper/2411.08813"},"observation_digest":"sha256:83f879a30b918a5a1fcc41e95a4d6c30cd64367060733d4069e88cfa7dafea1b","observation_id":"efffe38e-06bd-4e1e-953f-ea0581de270a","resolution":{"observed_at":"2026-08-12T21:23:34.502045Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T21:23:34.481811Z","title":"Code and data is present in our linked repository","venue":null,"work_id":"bbeb5e41-2af9-44af-a3c8-93633df0f678","year":null},"citing_paper":{"arxiv_id":"2411.08813","last_updated":"2024-11-13T17:51:57Z","snapshot_observed_at":"2026-08-19T09:02:12.405928Z","submitted_at":"2024-11-13T17:51:57Z","title":"Rethinking CyberSecEval: An LLM-Aided Approach to Evaluation Critique","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-12T21:23:33.597606Z"},"links":{"citing_paper":"/paper/2411.08813"},"observation_digest":"sha256:7a3af6234cc4c6dd6dae3b2a2055cd7f75ab2410acb6bdd837a9ac14054a02e8","observation_id":"fe63cb25-5d50-4d1e-880f-e079edf0d9ab","resolution":{"observed_at":"2026-08-12T21:23:34.486508Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T21:23:34.466504Z","title":"Guidelines: • The answer NA means that paper does not include experiments requiring code","venue":null,"work_id":"0c2cc43c-5c40-4756-9636-32e947cfa3b4","year":null},"citing_paper":{"arxiv_id":"2411.08813","last_updated":"2024-11-13T17:51:57Z","snapshot_observed_at":"2026-08-19T09:02:12.405928Z","submitted_at":"2024-11-13T17:51:57Z","title":"Rethinking CyberSecEval: An LLM-Aided Approach to Evaluation Critique","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-12T21:23:33.603534Z"},"links":{"citing_paper":"/paper/2411.08813"},"observation_digest":"sha256:518cd4c16fabe6f10fde62cb00700c4adc4eb7e0b29346daf7711c0893a2f396","observation_id":"b8ac6a2f-bdb0-472d-816e-3ae1135398da","resolution":{"observed_at":"2026-08-12T21:23:34.470950Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T21:23:34.451344Z","title":"Guidelines: • The answer NA means that the paper does not include experiments","venue":null,"work_id":"28152b19-3b07-460c-972e-476e0d61dcd2","year":null},"citing_paper":{"arxiv_id":"2411.08813","last_updated":"2024-11-13T17:51:57Z","snapshot_observed_at":"2026-08-19T09:02:12.405928Z","submitted_at":"2024-11-13T17:51:57Z","title":"Rethinking CyberSecEval: An LLM-Aided Approach to Evaluation Critique","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-12T21:23:33.610311Z"},"links":{"citing_paper":"/paper/2411.08813"},"observation_digest":"sha256:c2edead1833fea9ab10d9992d3a25968a66718c5843395b70695ace50d7f1dc9","observation_id":"a152e23e-d69a-41e6-8e47-768e07e15d6c","resolution":{"observed_at":"2026-08-12T21:23:34.456399Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T21:23:33.920776Z","title":"Guidelines: • The answer NA means that the paper does not involve crowdsourcing nor research with human subjects","venue":null,"work_id":"52a86da7-3c05-41e4-8b1d-83899fc5f58d","year":null},"citing_paper":{"arxiv_id":"2411.08813","last_updated":"2024-11-13T17:51:57Z","snapshot_observed_at":"2026-08-19T09:02:12.405928Z","submitted_at":"2024-11-13T17:51:57Z","title":"Rethinking CyberSecEval: An LLM-Aided Approach to Evaluation Critique","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-12T21:23:33.652249Z"},"links":{"citing_paper":"/paper/2411.08813"},"observation_digest":"sha256:c2e49578cd114d8701e855b7861f634edf6d09268ad1246473a894d56d0e4c1e","observation_id":"e02a0739-a668-4693-90db-59c44f080336","resolution":{"observed_at":"2026-08-12T21:23:33.926506Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T21:23:34.193363Z","title":"Guidelines: • The answer NA means that the paper does not include experiments","venue":null,"work_id":"5548b31e-a38b-4c89-a924-2fb676f336bb","year":null},"citing_paper":{"arxiv_id":"2411.08813","last_updated":"2024-11-13T17:51:57Z","snapshot_observed_at":"2026-08-19T09:02:12.405928Z","submitted_at":"2024-11-13T17:51:57Z","title":"Rethinking CyberSecEval: An LLM-Aided Approach to Evaluation Critique","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-12T21:23:33.620665Z"},"links":{"citing_paper":"/paper/2411.08813"},"observation_digest":"sha256:e9677bbb90af7aa34f6be43678418be5f90ef24a4b40cf12b82ae171ef946a7f","observation_id":"7dcc8101-474b-4cbb-85ce-b15e954feade","resolution":{"observed_at":"2026-08-12T21:23:34.206401Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T21:23:34.177767Z","title":"Guidelines: • The answer NA means that the authors have not reviewed the NeurIPS Code of Ethics","venue":null,"work_id":"873ac2ad-c91f-4194-b875-b09d069e8c33","year":null},"citing_paper":{"arxiv_id":"2411.08813","last_updated":"2024-11-13T17:51:57Z","snapshot_observed_at":"2026-08-19T09:02:12.405928Z","submitted_at":"2024-11-13T17:51:57Z","title":"Rethinking CyberSecEval: An LLM-Aided Approach to Evaluation Critique","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-12T21:23:33.625977Z"},"links":{"citing_paper":"/paper/2411.08813"},"observation_digest":"sha256:65eb61a69afca8a5509dd8b15203e43fce4c03bac77f0793b2d74417f6ac6d3e","observation_id":"d6079ee3-1e2a-477d-9799-39935b3bf0c3","resolution":{"observed_at":"2026-08-12T21:23:34.182711Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T21:23:34.160216Z","title":"Guidelines: • The answer NA means that there is no societal impact of the work performed","venue":null,"work_id":"fe01bf76-8ea4-4068-9f7a-52abf8cce64d","year":null},"citing_paper":{"arxiv_id":"2411.08813","last_updated":"2024-11-13T17:51:57Z","snapshot_observed_at":"2026-08-19T09:02:12.405928Z","submitted_at":"2024-11-13T17:51:57Z","title":"Rethinking CyberSecEval: An LLM-Aided Approach to Evaluation Critique","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-12T21:23:33.630343Z"},"links":{"citing_paper":"/paper/2411.08813"},"observation_digest":"sha256:a83a958478c232a60c031612c577d92eb05a0effdd23490d2aaa7739aa185c86","observation_id":"7562f6e1-7dae-45c4-b6b6-6258205171fd","resolution":{"observed_at":"2026-08-12T21:23:34.166596Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T21:23:33.972628Z","title":"Justification: Our research rests on a critique of a previously formulated benchmark, rather than the release of a model or data that can pose risks","venue":null,"work_id":"a8f8cea9-c276-4075-bb42-442b137c24da","year":null},"citing_paper":{"arxiv_id":"2411.08813","last_updated":"2024-11-13T17:51:57Z","snapshot_observed_at":"2026-08-19T09:02:12.405928Z","submitted_at":"2024-11-13T17:51:57Z","title":"Rethinking CyberSecEval: An LLM-Aided Approach to Evaluation Critique","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-12T21:23:33.635289Z"},"links":{"citing_paper":"/paper/2411.08813"},"observation_digest":"sha256:2450dd88b7afc4a8d30a99d55aca56fb56eb4c0edd2ad89e2f731bf4de87554e","observation_id":"5911e6ff-5788-4f03-9150-d3607f18e3d8","resolution":{"observed_at":"2026-08-12T21:23:34.055207Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T21:23:33.955280Z","title":"Any past research that has informed our own work is explicitly referenced","venue":null,"work_id":"118c1d8f-6a2f-4d8f-a099-f9c764b93220","year":null},"citing_paper":{"arxiv_id":"2411.08813","last_updated":"2024-11-13T17:51:57Z","snapshot_observed_at":"2026-08-19T09:02:12.405928Z","submitted_at":"2024-11-13T17:51:57Z","title":"Rethinking CyberSecEval: An LLM-Aided Approach to Evaluation Critique","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-12T21:23:33.641021Z"},"links":{"citing_paper":"/paper/2411.08813"},"observation_digest":"sha256:c4bf015dfcdd157a39c0f5a4d5966542c35fd060726f00fe955967632dcae82e","observation_id":"14ba8f22-f47f-4f6d-8903-ba40c4382788","resolution":{"observed_at":"2026-08-12T21:23:33.961039Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T21:23:33.937875Z","title":"Guidelines: • The answer NA means that the paper does not release new assets","venue":null,"work_id":"fe5b2183-91e8-4651-aea7-a78c6b33c704","year":null},"citing_paper":{"arxiv_id":"2411.08813","last_updated":"2024-11-13T17:51:57Z","snapshot_observed_at":"2026-08-19T09:02:12.405928Z","submitted_at":"2024-11-13T17:51:57Z","title":"Rethinking CyberSecEval: An LLM-Aided Approach to Evaluation Critique","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-12T21:23:33.646336Z"},"links":{"citing_paper":"/paper/2411.08813"},"observation_digest":"sha256:2b9e2c91418bdf47ae3c59f320eb7e8ca835e487147b1ed159858bdbddfba3da","observation_id":"063c1870-8160-4271-b491-bbf733e2ce6b","resolution":{"observed_at":"2026-08-12T21:23:33.943599Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T21:23:33.811457Z","title":"Guidelines: • The answer NA means that the paper does not involve crowdsourcing nor research with human subjects","venue":null,"work_id":"ea21f742-178d-4642-939c-35277b6f1cec","year":null},"citing_paper":{"arxiv_id":"2411.08813","last_updated":"2024-11-13T17:51:57Z","snapshot_observed_at":"2026-08-19T09:02:12.405928Z","submitted_at":"2024-11-13T17:51:57Z","title":"Rethinking CyberSecEval: An LLM-Aided Approach to Evaluation Critique","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-12T21:23:33.680086Z"},"links":{"citing_paper":"/paper/2411.08813"},"observation_digest":"sha256:f64e7d33ca38a78c79d7d692ffab2ee04c7bd2d4f8aac6971f7aa5c3b21faac0","observation_id":"dda8eebc-4db9-46ce-9527-b203d7261e30","resolution":{"observed_at":"2026-08-12T21:23:33.873318Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.01605","last_updated":"2024-09-06T18:17:07Z","snapshot_observed_at":"2026-08-19T21:56:58.303635Z","submitted_at":"2024-08-02T23:47:27Z","title":"CYBERSECEVAL 3: Advancing the Evaluation of Cybersecurity Risks and Capabilities in Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.01605","snapshot_observed_at":"2026-08-12T21:23:33.576348Z","title":"Using rand() for random number generation is insecure due to the weakness of the underlying algorithm","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.08813","last_updated":"2024-11-13T17:51:57Z","snapshot_observed_at":"2026-08-19T09:02:12.405928Z","submitted_at":"2024-11-13T17:51:57Z","title":"Rethinking CyberSecEval: An LLM-Aided Approach to Evaluation Critique","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-12T21:23:33.576348Z"},"links":{"cited_paper":"/paper/2408.01605","citing_paper":"/paper/2411.08813"},"observation_digest":"sha256:a9416278c2f2d4cb80379f378be0233d2e9fa39d7524afe53fa2a137ad8e0d02","observation_id":"6c8c340b-eab1-4714-b014-f49eaefd3efe","resolution":{"observed_at":"2026-08-12T21:23:33.576348Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2411.08813","last_updated":"2024-11-13T17:51:57Z","latest_version":1,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-19T09:02:12.405928Z","submitted_at":"2024-11-13T17:51:57Z","title":"Rethinking CyberSecEval: An LLM-Aided Approach to Evaluation Critique"},"reference_resolution":{"displayed":22,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":3,"verified_exact":0,"verified_fuzzy":19},"total_outbound_references":22},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"thesis":"As of 22 August 2026, this Paper Citation Record lists 22 of 22 outbound references and 2 inbound Pith citation observations for arXiv:2411.08813."}