{"as_of":"2026-08-13T22:03:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:99087e3567eb062a3c95ad2459cbdaabf3ecdbe3d63f79f5eec0876c43a81c68","coverage":[{"denominator":18,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":18,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T13:27:06.770620Z","state":"measured"},{"denominator":18,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":18,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-13T06:32:02.005865+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2411.16239/citation-record","integrity":"/paper/2411.16239/integrity","json":"/paper/2411.16239/citation-record.json","paper":"/paper/2411.16239"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:27:07.075116Z","title":"The multiple-choice question should provide four answer options, with non-correct options being similar or related to the correct answer","venue":null,"work_id":"1e199b80-62d9-4ae1-80b8-2c8fc8ef50f0","year":null},"citing_paper":{"arxiv_id":"2411.16239","last_updated":"2025-01-17T04:19:43Z","snapshot_observed_at":"2026-08-13T11:46:24.476166Z","submitted_at":"2024-11-25T09:54:42Z","title":"CS-Eval: A Comprehensive Large Language Model Benchmark for CyberSecurity","version":3},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-12T13:27:06.701093Z"},"links":{"citing_paper":"/paper/2411.16239"},"observation_digest":"sha256:408be12d40fbc7db9fcb393603c7c6f0512c441e3c1480cbc052c49e218771c4","observation_id":"d6223f76-b8bf-47fc-9623-9235a82aa926","resolution":{"observed_at":"2026-08-12T13:27:07.079989Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.09110","last_updated":"2023-10-01T21:44:23Z","snapshot_observed_at":"2026-08-10T23:10:13.900680Z","submitted_at":"2022-11-16T18:51:34Z","title":"Holistic Evaluation of Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.09110","snapshot_observed_at":"2026-08-12T13:27:06.690101Z","title":"https://github.com/XuanwuAI/SecEval","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.16239","last_updated":"2025-01-17T04:19:43Z","snapshot_observed_at":"2026-08-13T11:46:24.476166Z","submitted_at":"2024-11-25T09:54:42Z","title":"CS-Eval: A Comprehensive Large Language Model Benchmark for CyberSecurity","version":3},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-12T13:27:06.690101Z"},"links":{"cited_paper":"/paper/2211.09110","citing_paper":"/paper/2411.16239"},"observation_digest":"sha256:08d2f740e7253a6feb1f55a0c566b3c9bc624464ef0255b053d32f1ff6084e31","observation_id":"38462fc9-d789-48ce-8a39-a724681605a7","resolution":{"observed_at":"2026-08-12T13:27:06.690101Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:27:07.045061Z","title":"Offer four potential answers, making sure that the incorrect options are similar to the correct one","venue":null,"work_id":"232ec73d-f7be-4634-a806-b6a2812f77c9","year":null},"citing_paper":{"arxiv_id":"2411.16239","last_updated":"2025-01-17T04:19:43Z","snapshot_observed_at":"2026-08-13T11:46:24.476166Z","submitted_at":"2024-11-25T09:54:42Z","title":"CS-Eval: A Comprehensive Large Language Model Benchmark for CyberSecurity","version":3},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-12T13:27:06.711343Z"},"links":{"citing_paper":"/paper/2411.16239"},"observation_digest":"sha256:0598df5d5e0822d0c9136b829bf57f3c994adbf61fee99f3a83e28643c23b101","observation_id":"d0bfada8-5a51-4057-b44e-477677586e40","resolution":{"observed_at":"2026-08-12T13:27:07.049896Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:27:07.030158Z","title":"Offer yes or no answers","venue":null,"work_id":"434fa275-1cbc-4e50-897e-88150a835332","year":2023},"citing_paper":{"arxiv_id":"2411.16239","last_updated":"2025-01-17T04:19:43Z","snapshot_observed_at":"2026-08-13T11:46:24.476166Z","submitted_at":"2024-11-25T09:54:42Z","title":"CS-Eval: A Comprehensive Large Language Model Benchmark for CyberSecurity","version":3},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-12T13:27:06.716027Z"},"links":{"citing_paper":"/paper/2411.16239"},"observation_digest":"sha256:faaf217b9bb42307e546d500fce494e30b8db7790c8defded62f400de3061cc2","observation_id":"6df72d61-22f0-4855-ab47-4fc5765188aa","resolution":{"observed_at":"2026-08-12T13:27:07.035024Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:27:07.060156Z","title":"Provide four possible answers, including the correct one, and make sure the incorrect choices are similar or related to the right answer","venue":null,"work_id":"56ea3a39-69a8-4e36-a55b-154ae9118d37","year":null},"citing_paper":{"arxiv_id":"2411.16239","last_updated":"2025-01-17T04:19:43Z","snapshot_observed_at":"2026-08-13T11:46:24.476166Z","submitted_at":"2024-11-25T09:54:42Z","title":"CS-Eval: A Comprehensive Large Language Model Benchmark for CyberSecurity","version":3},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-12T13:27:06.706171Z"},"links":{"citing_paper":"/paper/2411.16239"},"observation_digest":"sha256:2303e17c7dfa6d04c8e24caaaf8a6235c978e95ebb175e4d51727866a63c3e7a","observation_id":"8c4f9870-5a72-4fed-bbdf-e1c023fc4010","resolution":{"observed_at":"2026-08-12T13:27:07.065007Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:27:06.936538Z","title":"For example, if the original question asks about the result of a specific action, the reversed question could ask about the conditions re- quired for that result to occur","venue":null,"work_id":"4ba50a6a-ae99-4769-a085-40bf066d2d5d","year":null},"citing_paper":{"arxiv_id":"2411.16239","last_updated":"2025-01-17T04:19:43Z","snapshot_observed_at":"2026-08-13T11:46:24.476166Z","submitted_at":"2024-11-25T09:54:42Z","title":"CS-Eval: A Comprehensive Large Language Model Benchmark for CyberSecurity","version":3},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-12T13:27:06.747016Z"},"links":{"citing_paper":"/paper/2411.16239"},"observation_digest":"sha256:6efa48441fbce4389971c0b4b89fc8e87de7e5ca9a9ff943eb72d603c5a108ca","observation_id":"d68ade81-76a4-41a5-99d2-0bfc6aa4c32d","resolution":{"observed_at":"2026-08-12T13:27:06.942721Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:27:06.919993Z","title":"{Original Question}","venue":null,"work_id":"f35e9f07-433f-4585-ab72-1a27cd05d484","year":null},"citing_paper":{"arxiv_id":"2411.16239","last_updated":"2025-01-17T04:19:43Z","snapshot_observed_at":"2026-08-13T11:46:24.476166Z","submitted_at":"2024-11-25T09:54:42Z","title":"CS-Eval: A Comprehensive Large Language Model Benchmark for CyberSecurity","version":3},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-12T13:27:06.751817Z"},"links":{"citing_paper":"/paper/2411.16239"},"observation_digest":"sha256:ebe425760b69de4ab7574cbdbd160f035d9897917fe8357fdb9076334a5fea6a","observation_id":"98dceb1b-d886-491e-bdd1-fc5ac4448c79","resolution":{"observed_at":"2026-08-12T13:27:06.924730Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:27:07.015468Z","title":"Ensure the question still tests the same core concept","venue":null,"work_id":"e681b946-b0e9-448e-95af-468f593d3521","year":null},"citing_paper":{"arxiv_id":"2411.16239","last_updated":"2025-01-17T04:19:43Z","snapshot_observed_at":"2026-08-13T11:46:24.476166Z","submitted_at":"2024-11-25T09:54:42Z","title":"CS-Eval: A Comprehensive Large Language Model Benchmark for CyberSecurity","version":3},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-12T13:27:06.721287Z"},"links":{"citing_paper":"/paper/2411.16239"},"observation_digest":"sha256:08dc196e769ce670e857713324bd813b75d656a93d57ac493a082ed0db2494e9","observation_id":"d10afb71-f4bd-43cc-a5be-7651a4b6a3a4","resolution":{"observed_at":"2026-08-12T13:27:07.020332Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:27:06.998833Z","title":"{Original Question}","venue":null,"work_id":"fa0517c7-afb3-4184-934d-d2fcb133aef4","year":null},"citing_paper":{"arxiv_id":"2411.16239","last_updated":"2025-01-17T04:19:43Z","snapshot_observed_at":"2026-08-13T11:46:24.476166Z","submitted_at":"2024-11-25T09:54:42Z","title":"CS-Eval: A Comprehensive Large Language Model Benchmark for CyberSecurity","version":3},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-12T13:27:06.726245Z"},"links":{"citing_paper":"/paper/2411.16239"},"observation_digest":"sha256:9e2d0390f69fe76de59d293b9ef759a5ff32539f25f90d0957f1527981c42e51","observation_id":"6f5c699c-3d24-4cb3-8fd2-4efc46a1bb4b","resolution":{"observed_at":"2026-08-12T13:27:07.003477Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:27:06.983710Z","title":"Ensure the question remains rel- evant to the original cybersecurity concept","venue":null,"work_id":"0c818fea-406b-4f86-ac18-f0fa93ea3b4a","year":null},"citing_paper":{"arxiv_id":"2411.16239","last_updated":"2025-01-17T04:19:43Z","snapshot_observed_at":"2026-08-13T11:46:24.476166Z","submitted_at":"2024-11-25T09:54:42Z","title":"CS-Eval: A Comprehensive Large Language Model Benchmark for CyberSecurity","version":3},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-12T13:27:06.731701Z"},"links":{"citing_paper":"/paper/2411.16239"},"observation_digest":"sha256:ee87e809c9ded74dff07180771ddb50726d11cfa2c84d2847eb46f233363677a","observation_id":"4b3bccfe-1558-42fa-8dc6-b1f553948c51","resolution":{"observed_at":"2026-08-12T13:27:06.988704Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:27:06.968719Z","title":"Ensure the question tests the same concept","venue":null,"work_id":"6fe3cfbf-f439-4393-97bc-ef90965e0755","year":null},"citing_paper":{"arxiv_id":"2411.16239","last_updated":"2025-01-17T04:19:43Z","snapshot_observed_at":"2026-08-13T11:46:24.476166Z","submitted_at":"2024-11-25T09:54:42Z","title":"CS-Eval: A Comprehensive Large Language Model Benchmark for CyberSecurity","version":3},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-12T13:27:06.737061Z"},"links":{"citing_paper":"/paper/2411.16239"},"observation_digest":"sha256:a858df61d1d554fe7ee383f43e6b9c2878ed1c0227827caab2db6daf76b6ab2c","observation_id":"6f6fb752-538b-4d2b-9ff7-889b47deb4b2","resolution":{"observed_at":"2026-08-12T13:27:06.973659Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:27:06.953689Z","title":"{Original Question}","venue":null,"work_id":"c4c8f3c7-c992-4e11-a7bb-d0f5a0675557","year":null},"citing_paper":{"arxiv_id":"2411.16239","last_updated":"2025-01-17T04:19:43Z","snapshot_observed_at":"2026-08-13T11:46:24.476166Z","submitted_at":"2024-11-25T09:54:42Z","title":"CS-Eval: A Comprehensive Large Language Model Benchmark for CyberSecurity","version":3},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-12T13:27:06.741964Z"},"links":{"citing_paper":"/paper/2411.16239"},"observation_digest":"sha256:b5a5c7445a083f3491d7aa5925f12589d2adf5cd5f4f8e046b4e7564ac9f3505","observation_id":"cfa993c3-36fb-4edb-9287-05d0d6f95d69","resolution":{"observed_at":"2026-08-12T13:27:06.958427Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:27:06.904282Z","title":"{Original Question}","venue":null,"work_id":"6e0be892-393f-4236-a3c7-da7ed3ac1e1c","year":null},"citing_paper":{"arxiv_id":"2411.16239","last_updated":"2025-01-17T04:19:43Z","snapshot_observed_at":"2026-08-13T11:46:24.476166Z","submitted_at":"2024-11-25T09:54:42Z","title":"CS-Eval: A Comprehensive Large Language Model Benchmark for CyberSecurity","version":3},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-12T13:27:06.756418Z"},"links":{"citing_paper":"/paper/2411.16239"},"observation_digest":"sha256:c4906fee7814c1fcb988317e553e80c4d676047e545e29f1056bc94e06c1fbab","observation_id":"323ec978-3e5a-440d-88a4-d35f6f3171bd","resolution":{"observed_at":"2026-08-12T13:27:06.909168Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:27:06.887478Z","title":"{Original Question} Table 8: Prompts for Question Reformulation Prompts for Dynamic Question Generation, Part 2","venue":null,"work_id":"87a33c1e-6597-4fff-b62a-65cdc741c346","year":null},"citing_paper":{"arxiv_id":"2411.16239","last_updated":"2025-01-17T04:19:43Z","snapshot_observed_at":"2026-08-13T11:46:24.476166Z","submitted_at":"2024-11-25T09:54:42Z","title":"CS-Eval: A Comprehensive Large Language Model Benchmark for CyberSecurity","version":3},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-12T13:27:06.761073Z"},"links":{"citing_paper":"/paper/2411.16239"},"observation_digest":"sha256:491a7e903a85bcb52e8df22e0a117c217089a9d6fe5ffb7da0c8565c21d30484","observation_id":"44b35c47-9be7-4d36-9956-5958f5560fa7","resolution":{"observed_at":"2026-08-12T13:27:06.893060Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:27:06.870795Z","title":"The questions are: {questions} Reply to me in the following format: ‘‘‘json [’knowledge point 1’, ’knowledge point 2’, ......] ‘‘‘","venue":null,"work_id":"6f28da2f-54d3-4bb4-a157-e762a8d10bc8","year":null},"citing_paper":{"arxiv_id":"2411.16239","last_updated":"2025-01-17T04:19:43Z","snapshot_observed_at":"2026-08-13T11:46:24.476166Z","submitted_at":"2024-11-25T09:54:42Z","title":"CS-Eval: A Comprehensive Large Language Model Benchmark for CyberSecurity","version":3},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-12T13:27:06.765625Z"},"links":{"citing_paper":"/paper/2411.16239"},"observation_digest":"sha256:fead7e45b70e562d2ec05cd2ce0bf8145ebebb5f81dea97143f72ec546ae9adf","observation_id":"916c879d-c879-41e5-b1dc-62767bbb9eee","resolution":{"observed_at":"2026-08-12T13:27:06.875943Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:27:06.852360Z","title":"Then rewrite it as a multiple-choice question by leav- ing one key position blank","venue":null,"work_id":"3082d13b-431a-4447-9e8d-edc750a73f9f","year":null},"citing_paper":{"arxiv_id":"2411.16239","last_updated":"2025-01-17T04:19:43Z","snapshot_observed_at":"2026-08-13T11:46:24.476166Z","submitted_at":"2024-11-25T09:54:42Z","title":"CS-Eval: A Comprehensive Large Language Model Benchmark for CyberSecurity","version":3},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-12T13:27:06.770620Z"},"links":{"citing_paper":"/paper/2411.16239"},"observation_digest":"sha256:28c3ac91e4554bcb956d6a68ca988bc4c95b0cca82a103e0a898eb80fbf52555","observation_id":"578995e8-0ca9-487b-8545-69d61c8db5c8","resolution":{"observed_at":"2026-08-12T13:27:06.859231Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.01769","last_updated":"2024-11-21T23:39:12Z","snapshot_observed_at":"2026-08-13T00:15:47.844263Z","submitted_at":"2024-05-02T22:43:02Z","title":"A Survey on Large Language Models for Critical Societal Domains: Finance, Healthcare, and Law","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.01769","snapshot_observed_at":"2026-08-12T13:27:06.683416Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.16239","last_updated":"2025-01-17T04:19:43Z","snapshot_observed_at":"2026-08-13T11:46:24.476166Z","submitted_at":"2024-11-25T09:54:42Z","title":"CS-Eval: A Comprehensive Large Language Model Benchmark for CyberSecurity","version":3},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-12T13:27:06.683416Z"},"links":{"cited_paper":"/paper/2405.01769","citing_paper":"/paper/2411.16239"},"observation_digest":"sha256:30f1c727d61525b5b78b0b746a55c02de9fe9a32ae73c9a4d52b1531153e9ae4","observation_id":"cae6d39c-90b5-48ae-abba-8f30f0f0f551","resolution":{"observed_at":"2026-08-12T13:27:06.683416Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.09975","last_updated":"2024-12-08T06:34:31Z","snapshot_observed_at":"2026-08-13T10:31:54.307521Z","submitted_at":"2023-08-19T10:38:00Z","title":"FinEval: A Chinese Financial Domain Knowledge Evaluation Benchmark for Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.09975","snapshot_observed_at":"2026-08-12T13:27:06.695774Z","title":"High-Confidence Computing, 100211","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.16239","last_updated":"2025-01-17T04:19:43Z","snapshot_observed_at":"2026-08-13T11:46:24.476166Z","submitted_at":"2024-11-25T09:54:42Z","title":"CS-Eval: A Comprehensive Large Language Model Benchmark for CyberSecurity","version":3},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-12T13:27:06.695774Z"},"links":{"cited_paper":"/paper/2308.09975","citing_paper":"/paper/2411.16239"},"observation_digest":"sha256:1500bf02a0002c9e6b90985245a24bc347ea61c77e04fe7a993708cb6afadb75","observation_id":"c1ad2b14-06d5-4e86-a267-0758ad84bb32","resolution":{"observed_at":"2026-08-12T13:27:06.695774Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2411.16239","last_updated":"2025-01-17T04:19:43Z","latest_version":3,"primary_category":"cs.CR","snapshot_observed_at":"2026-08-13T11:46:24.476166Z","submitted_at":"2024-11-25T09:54:42Z","title":"CS-Eval: A Comprehensive Large Language Model Benchmark for CyberSecurity"},"reference_resolution":{"displayed":18,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":3,"verified_exact":0,"verified_fuzzy":15},"total_outbound_references":18},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"thesis":"As of 13 August 2026, this Paper Citation Record lists 18 of 18 outbound references and 0 inbound Pith citation observations for arXiv:2411.16239."}